学习路径
最小可用路径(MVP · 约 3 小时)
0% 已掌握
本文基于模型知识整理。前置知识:Python 基础、HTML 直觉(见 00-overview.md,不属于本库展开范围)。
阶段一 · 入门(第 1 周)
建立「网页数据从哪来、长什么样、能不能采」的完整直觉。
- kp-001 爬虫全景与发展简史
- kp-002 HTTP 协议基础
- kp-003 HTML/DOM 与 CSS 选择器思维
- kp-004 抓取边界:Robots、法律与伦理(先于一切编码动作阅读)
- kp-005 Python 爬虫工具链与环境搭建
阶段二 · 核心静态抓取(第 2 周)
能独立抓完一个静态站点并落库。
- kp-006 requests 与会话管理
- kp-007 BeautifulSoup 与 lxml 解析
- kp-008 XPath 与选择器进阶
- kp-009 结构化数据抽取:JSON 接口
- kp-010 分页、列表与详情页采集模式
- kp-011 数据清洗与持久化
阶段三 · 动态与工程化(第 3–4 周)
面对真实商业站点(渲染、反爬、规模化)。
- kp-012 动态渲染识别 → kp-013 浏览器自动化 → kp-014 抓包分析
- kp-016 反爬机制全景 → kp-017 礼貌抓取(kp-015 接口逆向为选修进阶)
- kp-018 Scrapy → kp-019 异步 → kp-020 代理池 → kp-021 调度去重 → kp-022 分布式 → kp-023 监控
阶段四 · 数据挖掘(第 5 周)
让采到的数据产生价值。
- kp-024 管线与指标 → kp-025 数据质量
- kp-026 文本挖掘(TF-IDF)→ kp-027 时序价格 → kp-028 聚类关联 → kp-029 可视化
- 案例串讲:kp-030 电商 → kp-031 舆情 → kp-032 公开数据 → kp-033 工作流
阶段五 · 前沿选修(第 6 周起)
- kp-034 验证码 → kp-035 指纹 → kp-036 云原生 → kp-037 LLM 抽取
最小可用路径(MVP)
kp-001 → kp-002 → kp-003 → kp-005 → kp-006 → kp-007
→ kp-010 → kp-011 → kp-024 → kp-030
10 个知识点即可完成「目标 → 抓取 → 入库 → 电商分析案例」的最小闭环,约 3 小时学习 + 半天练习。学完 MVP 再回头补动态与工程化内容。
节奏建议
- 每篇预计 15–30 分钟,学完立即在练习站(books.toscrape.com / quotes.toscrape.com / httpbin.org)上跑一遍代码。
- 每阶段结束做一次「自测题回顾」:把该阶段各篇的自测题重做一遍,答错的回读对应机制小节。