机器学习基础 入门

监督学习:分类与回归

掌握两大监督任务——分类与回归的原理、常见算法与选型思路,附 scikit-learn 最小示例。

两大任务

  • 分类(Classification):预测离散类别 —— 工单分类(退款/物流/账号)、情绪判断(正/负/中性);
  • 回归(Regression):预测连续数值 —— 房价、销售额、回答耗时预估。

经典算法一览

  • 逻辑回归:简单高效的线性分类器,常作基线;
  • 决策树 / 随机森林:可解释性好,表格数据的常青树;
  • 梯度提升树(XGBoost/LightGBM):表格数据竞赛之王;
  • 神经网络:文本、图像等非结构化数据的主宰。

最小示例(scikit-learn)

from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.pipeline import make_pipeline

texts = ["退货太麻烦了", "物流三天没动", "账号登不上"]
labels = ["退款", "物流", "账号"]

model = make_pipeline(TfidfVectorizer(), LogisticRegression())
model.fit(texts, labels)              # 训练:数据+答案 → 规则
print(model.predict(["钱怎么退回来"]))  # ['退款']

注意思路与 LLM 的对比:监督学习要标注数据训练,LLM 零样本就能分类。但小数据量下,一个轻量分类模型可能更便宜、更稳定、更快 —— 两种手段是互补关系。

选型口诀

表格数据先试梯度提升树;文本/图像用神经网络;样本极少或要求强解释 → 规则 + LLM。

📝 课后练习

quiz-1 分类任务与回归任务的区别是?