监督学习:分类与回归
掌握两大监督任务——分类与回归的原理、常见算法与选型思路,附 scikit-learn 最小示例。
两大任务
- 分类(Classification):预测离散类别 —— 工单分类(退款/物流/账号)、情绪判断(正/负/中性);
- 回归(Regression):预测连续数值 —— 房价、销售额、回答耗时预估。
经典算法一览
- 逻辑回归:简单高效的线性分类器,常作基线;
- 决策树 / 随机森林:可解释性好,表格数据的常青树;
- 梯度提升树(XGBoost/LightGBM):表格数据竞赛之王;
- 神经网络:文本、图像等非结构化数据的主宰。
最小示例(scikit-learn)
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.pipeline import make_pipeline
texts = ["退货太麻烦了", "物流三天没动", "账号登不上"]
labels = ["退款", "物流", "账号"]
model = make_pipeline(TfidfVectorizer(), LogisticRegression())
model.fit(texts, labels) # 训练:数据+答案 → 规则
print(model.predict(["钱怎么退回来"])) # ['退款']
注意思路与 LLM 的对比:监督学习要标注数据训练,LLM 零样本就能分类。但小数据量下,一个轻量分类模型可能更便宜、更稳定、更快 —— 两种手段是互补关系。
选型口诀
表格数据先试梯度提升树;文本/图像用神经网络;样本极少或要求强解释 → 规则 + LLM。
📝 课后练习
quiz-1 分类任务与回归任务的区别是?