English version: AI Learning Roadmap 01 · Computer Foundations
01 · 计算机基础
AI 学习路线图 · 第 1 站(共 9 站)
为什么这一站重要
每一个 AI 系统——每一个模型、每一次训练、每一个智能体——本质上都是一个跑在计算机上的程序。如果你对这台机器不熟练,后面的每一站都会变成一场搏斗:你会把时间花在跟环境较劲上,而不是学习梯度下降或注意力机制。
好消息是:你不需要计算机科学学位。你需要的是对"AI 工作中真正重要的那 20% 计算机知识"有扎实的掌控。这正是这一站要交付的东西:
- Python —— 整个领域的语言。几乎所有 AI 库都说 Python。
- 开发者环境 —— 终端、Git、编辑器、笔记本。专业人士真正生活在这里。
- 计算机如何工作 —— 足以理解"跑一个模型"到底意味着什么。
- 必备数据结构与算法 —— 高效程序的词汇表。
- 网络基础 —— 因为每一次大模型 API 调用都是一个 HTTP 请求。
核心概念
1. Python —— 你的第一门语言
如果你从未编过程序,Python 是最温柔的入口。它读起来几乎像英语,而且它的哲学("可读性至上")意味着你在这里写的代码,会在你之后遇到的每一个 AI 库里都似曾相识。
从这些基础开始:
- **语法与数据类型:**整数、浮点数、字符串、布尔值;
if / elif / else;for和while循环。 - 四个主力数据结构:
list(有序、可变——数组)、dict(键 → 值,瞬间查找)、set(唯一元素,成员判断)、tuple(有序、不可变——固定记录)。这四样东西你 AI 生涯的每一天都会用到。 - 函数:
def 名称(参数): return ...。函数是把逻辑打包、便于复用和测试的方式。 - 推导式:
[x*2 for x in nums]—— 一行代码构建列表和字典的 Python 风格写法。一开始看着像魔法;一周之内你就会觉得自然。 - **模块与导入:**代码组织在文件(模块)和包(package)里。
import numpy as np将来会熟悉得像呼吸一样。 - 错误处理:
try / except—— 理解错误是调试的前半程。 - **面向对象基础:**类、属性、方法、
__init__。你需要的是词汇,不是理论;PyTorch 和所有框架都到处用类。
现在就开始养成一个重要习惯:写代码、运行、弄坏它、修好它。 读 Python 教程教不会你 Python。亲手把每个例子敲一遍。
2. 开发者环境
专业人士不是在单个窗口里写代码的。你需要四个工具协同工作:
- **终端。**一个用文本操作电脑的界面。你用它运行程序、安装包、管理 Git。要学:目录导航(
cd、ls/dir)、运行脚本(python script.py),并且明白"害怕终端"是不必要的——它只是一个带超能力的文本框。 - **Git 与 GitHub。**Git 记录你代码的每一次改动——你自己的撤销按钮和历史版本。GitHub 把这份历史放到网上,也是这个行业的职业名片。要学核心流程:
clone/add/commit/push/pull,外加branch和merge。你不需要高级 Git;你需要让日常流程变成肌肉记忆。 - **编辑器。**VS Code 是默认选择:免费、强大、内置 Python 支持。安装 Python 扩展和 Pylance 语言服务器。
- **Jupyter 笔记本。**一种把代码、输出和笔记混在一起的文档。AI 工作是探索性的,笔记本就是探索发生的地方。分析和实验在这里写;生产代码放在
.py文件里。
最后是包管理:Python 库用 pip(或 conda)安装。每个项目应该有自己的虚拟环境(venv),避免项目之间互相打架。要学:创建 venv、激活它、pip install <包>,并把版本固定到 requirements.txt 里。
3. 计算机实际如何工作
你不需要造一台计算机;你需要一个心智模型。下面这个就是关键:
- **一切都是数字。**文本、图像、声音——计算机统统以二进制数字存储。你作为 AI 从业者的工作,常常是把真实世界的东西变成数字(这被称为表示 representation)。
- **CPU、内存、磁盘。**CPU 执行指令;内存(RAM)存放 CPU 正在处理的资料;磁盘永久保存资料。当程序"运行"时,操作系统把它加载进内存,CPU 逐条执行。
- **进程与操作系统。**你的操作系统(Windows、macOS、Linux)是一个管理者:它同时运行很多程序(进程)、在它们之间分配 CPU、并让它们互不干扰。训练一个模型是一个进程;一个 API 服务器也是一个进程。
- **Python 如何运行。**Python 是解释型语言:解释器读取你的代码并逐步执行。这就是为什么 Python 比编译型语言慢,但写起来和迭代起来容易得多。AI 的秘诀在于:慢的内层循环是用底层编译型语言(C/C++)写的——Python 只是控制层。
4. 必备数据结构与算法
你的职业生涯里永远不会被要求实现一棵红黑树,但你必须理解数据结构是什么、什么时候该用哪一个。核心思想:结构的选择决定了操作的代价。
- 大 O 记号 —— 描述"有多快"的语言。它表示一个操作的成本如何随输入规模增长。
O(1)= 无论多大都瞬间完成(查字典键);O(n)= 随规模线性增长(扫描列表);O(n²)= 平方级(嵌套循环——要避免)。 - 数组 vs 链表 —— 数组(Python 的
list)在连续内存中存储元素,按下标访问是瞬时的;链表用指针把元素串起来。实践中你只会用数组;理解这个概念是为了理解内存。 - 哈希表 —— Python 的
dict。整个计算领域最重要的结构:键 → 值,O(1)查找。遇到任何"把这些东西分组/计数"的问题,第一直觉就是它。 - 栈与队列 —— 后进先出(LIFO)和先进先出(FIFO)的次序。你会在智能体的上下文管理和搜索算法里再次遇到它们。
- 树与图 —— 层级与网络。文件系统是一棵树;社交网络是一张图;向量数据库在概念上就是一张"相似事物"的图。要学:树遍历(DFS/BFS),以及"图 = 节点 + 边"这个想法。
- 排序与查找 ——
sort()已经存在;要理解为什么排序能让查找变快(二分查找是O(log n))。
为什么这对 AI 特别重要?因为每个数据集都是行的数组;每次 token 查找都是哈希表;每个检索系统都是查找问题;每个神经网络都是一张图。理解了这些结构,就是理解了这些系统。
5. 网络基础 —— 因为你每天都会调用 API
现代 AI 很大程度上是通过网络使用模型。这意味着 HTTP:
- HTTP 请求 —— 客户端(你的代码)向服务器发请求;服务器返回响应和状态码(200 = 正常,404 = 未找到,500 = 服务器错误)。
- API —— 通过 HTTP 对外暴露功能的服务器。几乎每家 AI 公司都通过 API 出售模型访问权限:你发文本,你收文本。
- JSON —— API 的标准数据格式。它长得像 Python 字典(因为就是受它启发的)。
{"role": "user", "content": "你好!"}—— 你在第 7 站会天天见到这个形状。
边做边学:用 Python 的 requests 库调用一个免费公共 API(天气、名言,什么都行),把返回的 JSON 打印出来。
工具与技能
这一站结束时,你应该熟练使用(而不仅仅是听说过):
| 工具 | 用途 |
|---|---|
| Python 3.12+ | 语言本身 |
| VS Code + Python 扩展 | 你的编辑器 |
| Git + GitHub | 版本控制与作品集 |
| Jupyter(VS Code 内或浏览器) | 探索性工作 |
| venv + pip | 包管理 |
动手任务
按顺序做。不要跳过"无聊"的部分——流畅才是目标。
- **Python 练习(第 1–5 天)。**写脚本:用
dict统计一段文本的词频;用推导式过滤和变换列表;定义带默认值和返回值的函数;用try/except优雅地捕获错误。 - **终端 + Git(第 3–7 天)。**建一个项目文件夹;
git init,add,commit,push 到新的 GitHub 仓库。一周内做三次提交(养成习惯)。 - **数据分析器(第 6–10 天)。**随便找一个 CSV 文件(下载一个公开的,比如天气或城市数据集)。写一个脚本:读文件、计算汇总统计(均值、最大值、计数)、打印一份小报告。这是你的第一个真正的程序。
- **API 调用(第 8–10 天)。**用
requests调用一个免费公共 API 并打印结构化输出。注意 JSON——你已经在做每个大模型应用都会做的事了。 - **数据结构热身(第 9–12 天)。**给定一个数字列表,用
set在O(n)时间内找出重复项;给定两个列表,找出交集。大声解释(真的说出来)为什么你的方案快。
里程碑检查点
满足以下条件,你才能进入第 2 站:
- 你能不打开教程,从零写一个 Python 脚本:读取 CSV、分析、打印报告。
- 你的项目在 GitHub 仓库里,至少 3 次有意义的提交。
- 你能不查资料说出
dict、set、list的查找成本各是多少,以及什么时候用哪个。 - 你能用
requests调用公共 API 并解析 JSON 响应。 - 你能用一句话解释运行
python my_script.py时发生了什么。
如果五条都轻松,就前进。如果不行,再多花一周——这些基础决定了你后面是顺风顺水还是步步挣扎。
精选资源
- 《用 Python 自动化无聊的事》(免费在线书)—— 最好的实用 Python 入门;做里面的项目,一个都别跳。
- CS50x(哈佛) —— 想要更深的计算机科学背景就选它;第 0–4 周覆盖编程、内存和数据结构。可选但很优秀。
- 《计算机科学精粹》(Wladston Ferreira Filho) —— 一本简短易读的书,覆盖大 O、数据结构和计算机工作原理。读前四章。
- Git 官方文档 / GitHub Skills —— 在浏览器里交互式练习 Git。
- Python 官方教程 —— 权威参考;早期略读,永远可以回来查。
时间规划
- **总计:**约 4 周,每周 10–15 小时(约 50 小时)。
- **建议安排:**第 1–2 周 → Python 流畅度(任务 1–2);第 3 周 → 数据分析器 + API(任务 3–4);第 4 周 → 数据结构、Git 打磨、里程碑。
衔接下一站
你的机器准备好了,你也准备好了。第 2 站才是真正的 AI 开始:一切模型赖以建立的数学。这里有个让你松口气的秘密——你已经知道一半了。向量不过是一串数字;矩阵乘法不过是一种结构化地组合它们的方式。我们先建立直觉,而这一站结束时,你会亲手用 NumPy 实现梯度下降。
No comments yet.