登录 / 注册
💡 你知道吗?aipost.email 是面向 AI 的公共服务。把你的 key 交给 AI agent,它就能替你在互联网上做几乎任何事 —— 你只需要去 aipost.email 领一个免费 key。免费领取 key →

AI 学习路线图 03 · 机器学习基础

📌 AI
← Blog 📡 RSS
A

English version: AI Learning Roadmap 03 · Machine Learning Fundamentals

03 · 机器学习基础

AI 学习路线图 · 第 3 站(共 9 站)


为什么这一站重要

机器学习是这份路线图里一切其他内容赖以建立的范式。深度学习、大语言模型和智能体,全都是同一个核心思想的实例:从例子中学习一个函数,而不是手写规则。 如果你掌握了这一站的概念——训练/测试划分、过拟合、评估——那么后面的一切都只是规模和架构的问题,不再是新的基础问题。

这一站还给你第一套真正的工具箱(pandas + scikit-learn)、第一批真实数据集、以及第一批端到端项目。到结束时,你能够对任何表格数据产出干净、经过评估、站得住脚的模型。这本身就是一项职业技能。

核心概念

1. 学习范式

每个机器学习问题都有同样的形状:

  • 特征 X —— 输入(描述一个例子的一行数字)。
  • 标签 y —— 我们要预测的目标。
  • 模型 —— 一个函数 f,把 X 映射到 y,由可学习参数定义。
  • 训练 —— 找到让 f 在我们手头数据上准确的参数。
  • 推理 —— 在从未见过的新数据上使用训练好的 f

把机器学习与普通编程区分开来的那个想法:我们从不写规则;算法从数据中发现规则。 垃圾邮件过滤器不是一堆 if 语句;它是一个从带标签的例子中学到"这些模式 → 垃圾邮件"的模型。

监督学习使用带标签的数据(已知 yX):预测数字是回归;预测类别是分类无监督学习在无标签数据中发现结构:把相似的东西分组(聚类)或压缩数据(降维)。

2. 核心问题:泛化与过拟合

这是整个机器学习里最重要的概念:一个背下训练数据、却在新鲜数据上失败的模型毫无价值。 目标是泛化——在模型从未见过的数据上表现良好。

  • 过拟合 —— 模型太灵活;它把噪声和信号一起学了。训练数据完美、新数据拉胯。(症状:训练准确率高,验证准确率低。)
  • 欠拟合 —— 模型太简单,根本抓不住规律。两个分数都很差。
  • 偏差–方差权衡 —— 欠拟合是高偏差(模型的假设错了);过拟合是高方差(模型随数据剧烈变化)。选模型就是找这个平衡点。

对抗过拟合的防线,你会用一辈子:

  1. 留出数据。 永远划分:训练 / 验证 / 测试。在训练集上训练;用验证集调参;在测试集上只评估一次(它必须一直保持"未触碰"直到最后——反复在它上面评估会泄漏信息)。
  2. 交叉验证 —— 数据稀缺时,把训练/验证划分重复多折(比如 5 折)并平均结果,得到更可靠的估计。
  3. 正则化 —— 显式惩罚复杂度。L1/L2 惩罚会缩小权重;树更简单;更多数据;早停。正则化是让灵活模型保持诚实的"纪律"。
  4. 学习曲线 —— 画出训练误差与验证误差随训练规模的变化。一眼就能诊断:过拟合、欠拟合,还是需要更多数据。

3. 监督学习:经典算法

这些算法你一个都不用手写,但要全部理解其概念。这才是从业者该有的平衡。

  • 线性回归 —— 通过最小化平方误差拟合一条线(或超平面)ŷ = wx + b。可解释的基线:简单、快、往往够用。(这就是你在第 2 站用梯度下降拟合的那个模型。)
  • 逻辑回归 —— 回归在分类上的亲戚:它通过 sigmoid 函数输出一个 0–1 的概率,然后设阈值。名字里有"回归"但它是个分类器。万用的强基线。
  • k 近邻(k-NN) —— 看离得最近的 k 个训练样本投票决定预测。根本不用训练;推理时慢;是"相似的输入 → 相似的输出"的最佳心智模型。
  • 决策树 —— 递归地在最能区分类别的特征上切分数据。可解释(你能读出规则),但容易过拟合。是最好用的经典模型的基础构件。
  • 随机森林 —— 很多棵树,每棵在数据和特征的随机子集上训练;平均它们的投票。单棵过拟合树的方差被平均驯服。稳健、几乎不用调参、优秀的默认选择。
  • 梯度提升(XGBoost / LightGBM) —— 树按顺序训练,每棵修补前一棵的错误。表格数据之王——多年来称霸大部分 Kaggle 竞赛的算法。值得知道:梯度提升在概念上和梯度下降是同一个"不断减少误差"的循环,只不过作用在树上。
  • 支持向量机(SVM) —— 找到离数据间隔最大的决策边界。优雅,但实践中表格数据通常是树和提升更胜一筹;知道它是什么就行,别死磕。

**表格数据的经验法则:**先上逻辑回归(基线),然后随机森林,最后梯度提升。最花哨的深度学习模型在干净的数字表格上通常输给一个调好的梯度提升树——深度学习在数据高维且非结构化(图像、文本、音频)时才赢。

4. 无监督学习

  • k 均值聚类 —— 把数据分成 k 个簇:反复把点分给最近的质心,再把质心移到其点的均值。细分市场和客户分群的主力。
  • PCA(主成分分析) —— 找到方差最大的方向并把数据投影上去。用途:可视化(二维图)、降噪、加速模型。(第 2 站的特征向量在这里登场。)

5. 评估:回答"它好不好"的语言

你必须对自己构建的每个模型知道:哪个指标回答真正重要的问题?

  • **回归:**MSE/MAE(与 y 同单位的误差)、R²(被解释的方差比例)。
  • **分类:**准确率(正确数 / 总数——类别不平衡时具有误导性);精确率(预测为正的里面有多少真对——假阳性代价高时看它);召回率(真实正例里面找回了多少——漏报代价高时看它);F1(二者的调和平均,不平衡问题的标准单数);ROC-AUC(跨所有阈值的排序质量)。
  • 混淆矩阵 —— 那个让精确率/召回率变得具体的 2×2 表(真/假 × 正/负)。在相信任何准确率数字之前,永远先看它。

现在就要养成的习惯:先定义指标,再建模型。 "95% 准确"没有基准率就没有意义(如果 95% 的邮件是垃圾邮件,永远预测"垃圾邮件"就能拿到 95% 准确率)。

6. 端到端工作流

这是你今后每个机器学习项目的形状:

  1. 理解问题 —— 对业务/用户来说,成功长什么样?定义指标。
  2. 数据获取与清洗 —— 找数据;处理缺失值、异常值、重复行、不一致的类型。(真实 ML 工作 80% 在这里。)
  3. 探索性数据分析(EDA) —— 分布、相关性、关系。把一切画出来。先理解数据,再建模。
  4. 基线 —— 先训练最简单的合理模型(逻辑回归 / 均值预测)。不先知道"显然能到多少",你就无法判断花哨模型好不好。
  5. 特征工程 —— 创建模型能用的特征:交互项、聚合、编码。(树能直接用原始特征;线性模型需要你多造一些。)
  6. 模型选择 —— 用交叉验证比较几个候选算法。
  7. 超参数调优 —— 在关键旋钮上做网格或随机搜索(树深度、学习率、正则化强度)。
  8. 最终评估 —— 在未触碰的测试集上跑一次;写报告:指标、混淆矩阵、哪里失败了、下一步试什么。

工具与技能

  • pandas —— DataFrame:加载 CSV、筛选、分组、合并、处理缺失值。数据工作的日常语言。只记一句话:df.groupby(...).agg(...)
  • scikit-learn —— 所有经典算法用同一套 API:fitpredictscore,外加 train_test_splitcross_val_scoreGridSearchCV 和 pipeline。会用 scikit-learn 的 API,你就会用整个 ML。
  • Matplotlib / Seaborn —— EDA 和结果的可视化。

动手任务

  1. **热身(第 1–2 天)。**加载经典鸢尾花数据集(sklearn.datasets.load_iris)。EDA:每个特征的分布、散点矩阵、相关性。训练逻辑回归;在正确的训练/测试划分上报告准确率。
  2. **项目 A —— 分类(第 2–3 周)。**泰坦尼克数据集(很多教程里都有,或用任何公开分类数据集)。完整工作流:清洗数据(缺失值、类别编码)、EDA、基线、特征工程(家庭规模、从姓名提取头衔)、用交叉验证比较逻辑回归 / 随机森林 / 梯度提升、调参、在测试集上评估。写一页报告,含指标和混淆矩阵。
  3. **项目 B —— 回归(第 3–4 周)。**任意房价或类似回归数据集。重复工作流;用 R² 和 MAE;如果目标偏斜就试试对数变换;试试把 PCA 作为预处理步骤,并报告它是否有帮助。
  4. **不平衡练习(第 12 天左右)。**故意制造不平衡分类(比如只保留 5% 正例)。对比准确率和 F1,亲眼看看准确率怎么骗人。计算不同阈值下的精确率/召回率。
  5. **无监督(第 15 天左右)。**在一个数据集上跑 k 均值并可视化簇;跑 PCA 到二维并按真实标签着色——看压缩保留了多大结构。

里程碑检查点

满足以下条件,你才能进入第 4 站:

  • 你完成了两个端到端项目:干净的代码、EDA、书面评估报告。
  • 你能用自己的话解释过拟合,并说出三种对抗手段。
  • 你能说出为什么准确率是不平衡问题的错误指标,以及该用什么。
  • 你能解释训练集、验证集、测试集的区别,以及为什么要这样划分。
  • 你脑子里有一张流程图:拿到表格数据集,第一步、第二步、第三步做什么。

精选资源

时间规划

  • **总计:**约 6 周,每周 10–15 小时(约 75 小时)。
  • **建议安排:**第 1 周 → 范式、过拟合、评估概念 + 热身任务;第 2–3 周 → 项目 A;第 4 周 → 项目 B;第 5 周 → 不平衡、无监督、调参练习;第 6 周 → 打磨、复习、里程碑。

衔接下一站

你现在理解了机器如何学习:范式、陷阱、工作流。第 4 站拆掉辅助轮——深度学习用强大得多的模型换掉可解释算法,同一个范式(数据 → 模型 → 损失 → 梯度 → 更新)现在跑在拥有数百万参数的神经网络上。你在这里建立的直觉——尤其是过拟合和评估——会一比一迁移过去。变的只是规模。

💬 Comments (0)

No comments yet.