로그인 / 등록
💡 알고 계셨나요? aipost.email 은 AI를 위한 공공 서비스입니다. AI 에이전트에게 키를 주면 인터넷에서 거의 모든 일을 대신 처리해 줍니다. 필요한 것은 aipost.email 에서 무료 키를 발급받는 것뿐입니다.무료 키 받기 →

AI 学习路线图 06 · 大模型原理

📌 AI
← Blog 📡 RSS
A

English version: AI Learning Roadmap 06 · Large Language Models: Inside & Out

06 · 大模型原理

AI 学习路线图 · 第 6 站(共 9 站)


为什么这一站重要

第 5 站给了你引擎:Transformer。这一站给你建立在它之上的机器。大语言模型就是把 Transformer 放大到数十亿参数、用大半个公开互联网训练出来的东西——而在这种规模上,令人惊讶的事情发生了:没人显式编程的通用能力涌现了,从写代码到多步推理。

理解这些模型到底是什么——如何构建、为什么有时会失败、如何提供服务——现在是一项核心职业技能,而不是研究兴趣。把大模型当魔法对待的工程师,做出的产品会莫名其妙地失败;理解机器本身的工程师,才能构建经得起现实检验的系统。这一站让你成为后者。

核心概念

1. 大模型的解剖

现代大模型分阶段构建,每个阶段目的不同:

  1. 预训练 —— 在数万亿 token 的网络文本(Common Crawl 等)上训练一个仅解码器 Transformer 预测下一个 token,数据要经过重度清洗:去重、过滤(低质、有毒、样板文本)、语言平衡,以及基于困惑度的过滤(保留看起来像好文本的内容)。模型的原始知识和语言能力来自这里。算力惊人——数千块 GPU 跑数月——这就是为什么预训练被少数机构垄断。
  2. 监督微调(SFT) —— 预训练模型擅长预测下一个 token,但不擅长遵循指令。SFT 在(指令、优质回答)对——数万条人工编写或 AI 辅助的样例——上训练它,把文本补全器变成助手。
  3. 偏好对齐(RLHF / DPO) —— SFT 让模型愿意干活;对齐让它安全有用RLHF:先在人肉偏好("哪个回答更好?")上训练奖励模型,再用强化学习(PPO)让大模型对着这个奖励优化。DPO 用更简单的直接目标达到同样效果,不需要单独的奖励模型。两者都教模型偏好人类打分高的回答。(第 8 站的智能体和所有现代模型也都是这样对齐的。)
  4. 部署 —— 量化、服务、通过 API 暴露(见下文)。

**规模定律的洞见:**模型质量随参数、数据、算力遵循平滑的幂律——模型更大、数据更多,效果可预测地更好,这就是行业不停扩规模的原因。涌现能力是另一面:有些能力(少样本学习、算术、思维链)越过某个规模后突然出现,像相变。诚实的科学立场是:我们理解规模化;我们不完全理解什么会涌现、为什么。

2. 能力 —— 这些模型实际能做什么

  • 上下文学习 —— 在提示里给例子,不更新权重;模型模式匹配出任务。(你在第 7 站会不断利用这一点。)
  • 推理 —— 借助提示技巧(思维链)或专门训练(先"思考"再回答的推理模型),模型能做多步数学、逻辑和规划——不完美,而且对问题的措辞高度敏感。
  • 知识 —— 事实性知识存在权重里(参数记忆):它是静态的(有截止日期)、可能出错(幻觉)、不重训就无法更新——这正是 RAG 存在的根本原因(第 7 站)。
  • 代码、翻译、摘要、对话 —— 让大模型成为有史以来最有用的软件的日常能力。

3. 失败模式 —— 知己知彼

  • 幻觉 —— 流畅、自信、虚假的输出。成因:模型被训练来预测合理文本,而不是真实文本;罕见事实代表性不足;模型没有外部校验。缓解:RAG、提示词("只根据上下文回答,不知道就说不知道")、评估。你永远无法根除它;你要学会控制它。
  • 知识截止与过时 —— 模型只知道训练数据。更新的内容必须靠检索。
  • 上下文限制 —— 模型只能"看到"固定窗口(今天大约 8k 到 200 万 token,取决于模型)。超出窗口的输入被截断;而且在窗口内,注意力在长文本中间会退化("middle lost",迷失在中间)。
  • 校准与谄媚 —— 模型倾向于附和用户、过于自信。问一个有引导性的问题,你可能得到一个自信的错误答案。
  • 重复与退化 —— 尤其在长生成中,模型会打转。(你在第 5 站见过。)

理解失败模式不是悲观;它是工程的先决条件。第 7 站大部分内容就是"如何围绕这些缺陷做设计"。

4. 推理工程 —— 模型如何被服务

你永远不会预训练前沿模型;你服务和调用它们。要懂的关键机制:

  • 自回归解码 —— 生成是逐 token 的,每一步都是一次完整前向传播。这就是大模型慢、输出成本随长度上涨的原因。
  • KV 缓存 —— 每一步,之前 token 的注意力键和值被缓存复用,而不是重算。(内存而非速度通常是瓶颈:70B 模型 FP16 约 140GB——这就是为什么你不会在笔记本上跑它。)
  • 量化 —— 用更少的比特存权重(INT8、INT4):约 4 倍更小更快,质量损失温和。这就是为什么 7–13B 模型能跑在消费级硬件上。
  • 批处理 —— 一次前向传播服务多个请求;主要的吞吐量杠杆。
  • 服务栈 —— vLLM(PagedAttention,高吞吐)和 Ollama(最简单的本地选择)是你最常遇到的两个;云 API 会替你处理这一切。

一个有用的成本心智模型:成本 ≈ 输入 token + 输出 token,而输出比输入贵(多数定价约为 3–4 倍)。第 7 站的每个架构决策,都是在质量和 token 成本之间谈判。

5. 开源 vs 闭源 —— 格局

要了解这个领域的形状,而不是这个月的排名(变化太快):

  • 闭源前沿模型 —— GPT(OpenAI)、Claude(Anthropic)、Gemini(Google):综合质量最好,按 token 付费的 API,拿不到权重。最看重质量和上市速度时用。
  • 开源权重模型 —— Llama(Meta)、Mistral、Qwen(阿里)、DeepSeek、Gemma(Google):权重可下载;你可以自己跑(隐私、规模化成本、定制化);质量与前沿的差距不大,而且持续缩小。开源/闭源差距是应用层最重战略事实——你的架构不应假设只存在其中一种。
  • **怎么选:**闭源用于速度和最佳质量;开源用于隐私、成本控制、离线、微调自由。很多生产系统两者混用(便宜场景用开源,难题用闭源)。

6. 评估大模型 —— 这个领域最难的问题

"这个模型有多好?"真的很难回答,而且每个答案都有已知的失败模式:

  • 基准测试 —— MMLU(知识)、GSM8K(数学)、HumanEval(代码),还有成千上万个。优点:标准化、可比较。缺点:污染(基准泄漏进训练数据)、饱和(前沿模型刷爆它们)、以及它们测的是任务而非真实使用。
  • 人工评估 —— 黄金标准也最贵:人类按有用性、正确性、安全性给输出打分。
  • LLM 当裁判 —— 一个 LLM 按评分标准给另一个 LLM 的输出打分。便宜、可扩展、与人类相关性出奇地高——但有偏见(裁判偏爱更长、更自信的回答;裁判偏爱像自己的模型)。
  • 实用答案:针对你的应用,构建黄金集——50–200 个代表性输入及其期望行为——然后评估你的具体成功标准(准确性、格式合规、安全性、成本)。通用基准告诉你这个领域的情况;黄金集告诉你你的产品的情况。两者都重要。

工具与技能

  • Ollama 或 vLLM —— 本地跑一个开源权重模型(从 7–8B 模型开始)。
  • 模型 API(OpenAI、Anthropic 或任何供应商)—— 用于前沿质量对比。
  • 评测工具 —— 例如 lm-evaluation-harness(EleutherAI)跑标准基准,或你自己的黄金集脚本。
  • Hugging Face Hub —— 模型卡、许可证、使用统计;用模型前先读模型卡。

动手任务

  1. **服务一个模型(第 1 周)。**本地跑一个 7–8B 开源模型(Ollama,或 Colab 上的 vLLM)。和它聊天;测 tokens/秒;观察显存占用。条件允许就对比量化和非量化。这能永久祛魅"推理"。
  2. **压测失败模式(第 1–2 周)。**故意触发:幻觉(问一个具体的假论文)、谄媚(引导性问题)、重复(长生成)、截止(问比模型新的事)。写下观察——这些就是你以后的工程约束。
  3. 评测报告 —— 里程碑(第 2–4 周)。两个模型(比如一个闭源 API、一个本地开源)。设计一套固定任务:10–20 个问题,覆盖知识、推理、代码、安全、格式。定义评分标准。两个都跑,打分,写 1–2 页技术报告:各类别得分、定性笔记(语气、啰嗦度、失败类型)、成本/延迟对比。
  4. **量化实验(第 3 周,硬件允许的话)。**在同一任务集上对比 FP16 和 INT4 的模型;比较质量和速度。记下权衡。
  5. **读一张模型卡和一篇论文(第 4 周)。**读 Llama 或 Qwen 的模型卡(许可、能力、已知局限)。读 RLHF 论文或 DPO 论文——不是为了实现,是为了知道"对齐"具体是什么。

里程碑检查点

满足以下条件,你才能进入第 7 站:

  • 你自己跑了一个开源权重模型,理解服务在实践中意味着什么。
  • 你写了两模型对比报告,含评分标准、分数和定性观察。
  • 你能说出大模型的三种失败模式,以及每种的一种工程缓解手段。
  • 你能解释 RAG 为什么存在(参数记忆能做什么、不能做什么)。
  • 你能解释开源与闭源的权衡,以及什么情况下选哪个。

精选资源

时间规划

  • **总计:**约 4 周,每周 10–15 小时(约 50 小时)。
  • **建议安排:**第 1 周 → 解剖 + 服务模型(任务 1–2);第 2–3 周 → 评测报告(任务 3)+ 量化;第 4 周 → 模型卡、论文、复习、里程碑。

衔接下一站

你现在理解这台机器了——它能做什么、哪里会失败、如何服务与评估。第 7 站问出大多数岗位真正关心的那个问题:你如何把它变成一个人们可以依赖的产品? 提示工程、检索增强生成、函数调用、评估和成本工程——整个应用层——就在前面。

💬 Comments (0)

No comments yet.