6-5 有监督学习与无监督学习

🎯 教学目标与重难点…

【三维目标】

  • 📚 知识目标
    1. 理解有监督学习的核心定义:数据有标签(有标准答案),目标是“预测”。
    2. 理解无监督学习的核心定义:数据无标签(无标准答案),目标是“发现结构”。
    3. 掌握有监督学习的两个子任务:回归(预测连续值)分类(预测离散类别)
    4. 掌握无监督学习的两个子任务:聚类(自动分组)降维(数据压缩)
  • ⚙️ 能力目标
    1. 能根据业务场景(是否有历史答案、预测目标是什么)快速判断该用哪类算法。
    2. 能将本课程后续的算法(线性回归、逻辑回归、KNN、决策树、K-Means、PCA)正确归类到对应阵营。
  • 💡 素养目标
    1. 建立“拿到一个业务问题,先判断有监督还是无监督”的职业习惯。
    2. 理解“数据决定问题上限,算法只是逼近上限”的行业名言。

【重点与难点】

  • 🟢 教学重点
    1. 区分有监督(有Y)和无监督(无Y)的本质标准。
    2. 回归与分类的区别:输出是“数值”(房价)还是“类别”(猫/狗)。
  • 🟡 教学难点
    1. 半监督学习概念的简单提及(有些数据有标签,有些没有,但职高阶段了解即可)。
    2. 无监督学习中的“降维”与“聚类”各自解决什么问题(聚类是分组,降维是压缩)。

📌 一、 课程导入(5 分钟)

情景模拟:新来的实习生 vs 老员工

场景A(有老师带): 公司来了一个实习生小张。主管给他 1000 条历史销售数据,每条都标明了“最终是否成交”(成交=1,未成交=0),并且附带了“客户年龄、收入、访问时长”等细节。 主管说:“小张,你根据这些历史规律,预测一下今天这 10 个新客户哪些会成交?” 👉 这就是有监督学习:有历史答案(标签),让机器照着规律预测未来。

场景B(自己摸索): 公司又来了一个实习生小李。主管给他 1000 条客户数据,但没有任何标记(不知道谁成交了)。 主管说:“小李,你把这些客户分分类,看看有没有什么相似的群体,比如‘高净值客户群’、‘价格敏感型客户群’?” 👉 这就是无监督学习:没有标准答案,让机器自己去发现数据里的“隐藏结构”。

引出核心结论: 机器学习的算法千千万,但站队只有两个阵营——有监督无监督。区别就在于:训练数据有没有“标准答案”(标签 Y)

  • 👨‍🏫 教师活动:用 PPT 展示两个实习生的场景图。提问:“如果你是小张,你的任务是什么?如果你是小李,你的任务又是什么?”
  • 🧑‍🎓 学生活动:学生快速回答“小张是预测”、“小李是分组”。老师顺势板书两个阵营的名字,并强调“看有没有 Y”这个黄金判断标准。

用“实习生带教”的场景,将抽象的“标签”概念具象化为“主管给的参考答案”。职高学生对实习场景有亲切感,能瞬间建立“有答案 vs 没答案”的直觉。


📖 二、 解决问题过程(一):有监督学习——预测的艺术

1. 定义(一句话概括)

有监督学习 = 给定输入 X 和对应的正确答案 Y,让机器学会从 X → Y 的映射关系,从而对新的 X 预测 Y。

2. 两大分支(核心考点)

分支 任务 Y 的类型 生活案例 本课程对应算法
回归 预测连续数值 整数或小数(任意大小) 预测房价 150万、预测温度 26.5℃ 线性回归、岭回归、Lasso
分类 预测离散类别 有限的几个选项(0/1/2) 判断邮件垃圾/正常、识别猫/狗 逻辑回归、KNN、决策树、SVM、朴素贝叶斯

3. 回归 vs 分类 核心辨析(口诀)

“回归算数,分类算类”

  • 回归:问你“多少钱?”、“多少度?”——答案是数字。
  • 分类:问你“是不是?”、“是哪一类?”——答案是类别标签。

4. 课堂互动判断(教师口头提问)

场景 是有监督吗? 是回归还是分类?
根据学历和工作年限预测月薪 ✅ 有监督(有历史月薪) 回归(月薪是个数值)
根据 CT 影像判断是否患病 ✅ 有监督(有历史诊断结果) 分类(患病/未患病)
根据历史交易记录,预测明天股票收盘价 ✅ 有监督 回归(收盘价是数字)
  • 👨‍🏫 教师活动
    1. 在黑板上画出一个坐标轴,X轴是“面积”,Y轴是“房价”,画出散点图和拟合直线——直观展示回归就是“找一条线去贴近这些点”。
    2. 展示一张猫和狗的图片,说明分类就是“画一条界线把两类分开”。
  • 🧑‍🎓 学生活动
    1. 学生跟随老师的“课堂互动判断”快速举手回答(回归举左手,分类举右手),形成全员参与的快速反应游戏。
    2. 学生翻开课程大纲,将 8-1 到 14-1 的所有算法按“回归/分类”归类。

用“坐标轴画线”和“猫狗分界线”的直观图形,把回归和分类的本质差异刻进脑子里。通过“举手游戏”实现全员参与,避免前排互动后排睡觉的课堂现象。


💻 三、 解决问题过程(二):无监督学习——发现的乐趣

1. 定义(一句话概括)

无监督学习 = 只有输入 X,没有标准答案 Y。机器需要自己从数据中发现隐藏的结构、模式或规律。

2. 两大分支

分支 任务 目标 生活案例 本课程对应算法
聚类 自动分组 把相似的数据点聚成一堆 今日头条给读者自动分群(体育迷、科技迷) K-Means
降维 数据压缩 用更少的特征保留尽可能多的信息 把 100 个体检指标压缩成 5 个综合健康指数 PCA / SVD

3. 无监督学习的“神奇”与“局限”

  • 神奇:它能在没有参考答案的情况下,发现人类未必能一眼看出的潜在模式(比如电商发现“凌晨 1 点下单”的群体具有高退货率)。
  • 局限:因为没有正确答案,评估模型好坏比较主观(不像有监督可以拿预测值和真实值算误差)。分出来的组到底有没有用,需要业务专家来判断。

4. 有监督 vs 无监督 核心对比表(课堂必抄)

对比维度 有监督学习 无监督学习
训练数据 有 X 和 Y(有答案) 只有 X(没答案)
核心任务 预测(Prediction) 发现(Discovery)
典型算法 线性回归、逻辑回归、决策树、SVM K-Means、PCA
评估方式 用测试集的误差(MSE、准确率)量化评估 主观评估、业务验证(看分组是否有意义)
类比 考试有标准答案,老师批改 考古挖掘,挖出什么算什么,自己分析价值
  • 👨‍🏫 教师活动
    1. 画出一堆没有标签的点,用圆圈画出 K-Means 聚出来的三个簇。
    2. 提问:“如果我们有历史成交标签,这就是有监督;如果没有任何标签,就是无监督。哪个更难?”(学生答:无监督,因为不知道对不对)。
  • 🧑‍🎓 学生活动
    1. 学生两人一组,讨论:“超市的会员卡数据(消费记录、到店频率)没有标注用户类型,如果想做精准营销,应该用有监督还是无监督?”(答案:先用无监督聚类分群,再看各群特点)。
    2. 学生在表格中填写自己学过的算法属于哪一类(为后续章节做铺垫)。

用“考古挖掘”类比无监督,让学生理解“没有标准答案不等于没有价值”。同时明确指出两种学习的评估差异,为后续第8章(回归评估)和第9章(分类评估)以及第15章(聚类评估)做铺垫。


✍️ 四、 解决问题过程(三):课堂实战——算法“分阵营”大挑战

📝 任务一:场景判断与算法归类(小组对抗赛)…

规则:每组同学拿到以下 8 个业务场景,请判断属于“有监督”还是“无监督”。如果有监督,请进一步判断是“回归”还是“分类”;如果无监督,请判断是“聚类”还是“降维”。

题目列表

  1. 房价预测:根据房屋面积、卧室数量、房龄,预测售价(万元)。
  2. 手写数字识别:根据 8×8 像素图片,识别它是 0-9 中的哪个数字。
  3. 客户分群:根据电商客户的购买记录、浏览行为,自动将他们分成 5 个不同的群体。
  4. 人脸识别门禁:根据摄像头捕捉的人脸特征,判断是不是本公司的员工。
  5. 图像压缩:将一张 1024×1024 的高清图片,用 PCA 压缩成 256×256 的缩略图,但仍能看出主要内容。
  6. 共享单车需求量预测:根据天气、温度、是否为节假日,预测今天下午 5 点的单车租用数量(辆)。
  7. 垃圾短信过滤:根据短信内容关键词,判断是“正常”还是“垃圾”。
  8. 电影推荐:根据所有用户的观看历史和评分,自动将电影分成“动作片爱好者必看”、“文艺片爱好者必看”等几个组(没有预先的标签)。
🔍 查看答案与解析…
题号 阵营 子类型 解析
1 ✅ 有监督 回归 售价是连续的数值(如 150.5 万)
2 ✅ 有监督 分类 输出是 0~9 共 10 个离散类别
3 ❌ 无监督 聚类 没有预先给定“高价值客户”的标签,让机器自动分群
4 ✅ 有监督 分类 输出是“员工/非员工”二分类
5 ❌ 无监督 降维 用 PCA 压缩像素,保留主要信息
6 ✅ 有监督 回归 租用数量是连续数字(如 320 辆)
7 ✅ 有监督 分类 输出是“垃圾/正常”二分类
8 ❌ 无监督 聚类 没有“动作片”的预先标签,机器根据用户行为自动聚类发现模式

📝 五、 课堂小结(5 分钟)

flowchart TB
    root["🤖 机器学习算法总览"]

    root --> C1["📚 有监督学习(有标签 Y)"]
    root --> C2["🔍 无监督学习(无标签 Y)"]

    C1 --> C1a["📈 回归(预测数值)"]
    C1 --> C1b["🏷️ 分类(预测类别)"]

    C1a --> A1["线性回归<br>岭回归/Lasso"]
    C1b --> A2["逻辑回归<br>决策树/SVM<br>KNN/朴素贝叶斯"]

    C2 --> C2a["📦 聚类(自动分组)"]
    C2 --> C2b["📉 降维(数据压缩)"]

    C2a --> B1["K-Means"]
    C2b --> B2["PCA / SVD"]

    style root fill:#4b6cb7,stroke:#253b6e,color:#fff,stroke-width:2px
    style C1 fill:#e3f2fd,stroke:#2196f3
    style C2 fill:#fff3e0,stroke:#ff9800
    style C1a fill:#bbdefb,stroke:#1976d2
    style C1b fill:#bbdefb,stroke:#1976d2
    style C2a fill:#ffe0b2,stroke:#f57c00
    style C2b fill:#ffe0b2,stroke:#f57c00

✏️ 随堂检测与互动练习

点击展开:随堂测试题(带解析)

一、 单选题

  1. 以下哪个场景最可能使用无监督学习?
  • A. 根据历史天气数据预测明天的气温
  • B. 根据用户行为将用户自动划分为“学生党”、“上班族”、“宝妈”三个群体
  • C. 根据邮件内容判断是否为垃圾邮件
  • D. 根据 CT 影像判断是否患有肺炎
【答案】

【解析】B。A、C、D 都有明确的历史答案(气温数值、垃圾/正常标签、患病/未患病标签),属于有监督。B 没有任何预先标签,让机器自动分组,属于无监督聚类。

  1. 下列哪个算法属于“有监督学习”中的“回归”任务?
  • A. K-Means
  • B. 逻辑回归(预测是否患病)
  • C. 线性回归(预测房价)
  • D. PCA 主成分分析
【答案】

【解析】C。线性回归的输出是连续数值(房价),属于回归。注意:逻辑回归虽然名字带“回归”,但它是分类算法(输出是概率和类别),这是经典易错点!

  1. 无监督学习中的“聚类”和“降维”的本质区别是什么?
  • A. 聚类是压缩特征数,降维是自动分组
  • B. 聚类是自动分组(找相似),降维是压缩特征(提炼精华)
  • C. 两者没有区别,只是名字不同
  • D. 聚类必须有标签,降维不需要标签
【答案】

【解析】B。聚类是把样本分成不同的组(横向分组),降维是把特征数量减少(纵向压缩)。

二、 简答题

题目:某电商平台有 100 万条用户交易数据,每条数据包含“用户 ID、购买金额、购买频次、最近购买时间”。老板想做一个“沉睡用户唤醒”活动,但不知道哪些用户算“沉睡用户”。请问:你会用有监督还是无监督学习来解决这个问题?具体会用什么算法?请简述思路。

【答案】

【解析】:首先用无监督学习中的 K-Means 聚类。因为没有历史标签(不知道谁算沉睡),所以让算法根据“购买金额、频次、最近时间”这三个特征自动将用户分成若干个簇。业务人员再观察各簇特征:购买金额极低、频次极少、最近一次购买在 90 天以上的那个簇,就是“沉睡用户群”。这就是典型的“无监督探索 -> 业务定义”的实战流程。


📮 六、 课后作业与拓展

📮 课后作业…
  1. 基础分类题:请将以下场景归类到“有监督回归”、“有监督分类”、“无监督聚类”、“无监督降维”四个格子中:
    • (a) 根据身高体重预测 BMI 指数
    • (b) 新闻网站将今日 100 条新闻自动分成“体育”、“科技”、“娱乐”三组
    • (c) 银行根据征信记录判断是否批贷(批/不批)
    • (d) 用 PCA 将 20 个音频特征压缩成 5 个
  2. 课程串联题:回顾前两节学过的预处理(标准化、独热编码、PCA),PCA 属于哪类学习?(答案:无监督降维,因为它不需要标签 Y)。
  3. 思考题:我们现在有 1000 条客户的“年龄、收入、消费金额”数据,其中 100 条标明了“是/否高价值客户”(有标签),900 条没有标签。如果你既想利用那 100 条标签,又想利用那 900 条无标签数据,有没有办法?(引出“半监督学习”的概念,拓展视野)。
  4. 预习任务:从下一章(第8章)开始,我们将逐个攻克有监督学习的算法。请预习 8-1 线性回归,思考:线性回归的“线”是怎么画出来的?
  5. 职高衔接拓展:你在电商公司做运营,老板说“帮我预测下个月销售额”,这是有监督的回归问题。老板又说“帮我把商品分成热销、滞销、潜力三类”,这是无监督的聚类问题。请各举一个你将来工作中可能遇到的场景。

📋 七、 板书设计

🛠️ 板书设计…
 1第六章 机器学习两大阵营
 26.3 有监督学习 vs 无监督学习
 3
 4一、判断黄金标准:有没有“标准答案”(标签 Y)?
 5   - 有 Y → 有监督
 6   - 无 Y → 无监督
 7
 8二、有监督学习(预测)
 9   1. 回归(Regression) -> 输出连续数值
10      -> 例子:房价预测、温度预测
11      -> 算法:线性回归、岭回归、Lasso
12   2. 分类(Classification) -> 输出离散类别
13      -> 例子:猫狗识别、垃圾邮件过滤
14      -> 算法:逻辑回归、决策树、SVM、KNN、朴素贝叶斯
15
16三、无监督学习(发现)
17   1. 聚类(Clustering) -> 自动分组
18      -> 例子:用户分群、新闻分类
19      -> 算法:K-Means
20   2. 降维(Dimensionality Reduction) -> 特征压缩
21      -> 例子:图片压缩、数据可视化
22      -> 算法:PCA / SVD
23
24⚠️ 注意陷阱:
25   “逻辑回归” 名字叫回归,但它属于 【分类】!

本课用到的单词

单词 发音 专业英语解释(中文)
Supervised Learning /ˌsuːpərˈvaɪzd ˈlɜːrnɪŋ/ 有监督学习。使用带标签的数据训练模型,以预测新数据标签的机器学习范式。
Unsupervised Learning /ʌnˈsɜːrpərvaɪzd ˈlɜːrnɪŋ/ 无监督学习。使用无标签数据,让模型自行发现数据中隐藏的结构或模式的机器学习范式。
Regression /rɪˈɡreʃən/ 回归。预测连续数值输出的任务。
Classification /ˌklæsɪfɪˈkeɪʃən/ 分类。预测离散类别标签的任务。
Clustering /ˈklʌstərɪŋ/ 聚类。将数据点分组,使组内相似度高、组间相似度低的无监督任务。
Label /ˈleɪbəl/ 标签。有监督学习中的“正确答案”Y,如“猫/狗”或“房价数值”。
Feature /ˈfiːtʃər/ 特征。输入数据 X 中的可测量属性,如“年龄”、“收入”。

🚀 下节课预告(6.4 模型评估)

我们已经站在了算法的起跑线上!下一节课(6.4)我们将学习一个极其重要的概念——模型评估。就像考试完了要批改试卷一样,模型训练完了怎么知道它学得好不好?我们将学习 训练集/测试集划分交叉验证 等关键技能,为第8章开始的“算法实战”打好地基!