知识地图 连线为 prerequisites 依赖(由各篇 frontmatter 派生)。箭头指向依赖的前置知识点。 01-基础与全景爬虫全景与发展简史入门 · 20minHTTP 协议基础:请求、响应与会话入门 · 25minHTML/DOM 与 CSS 选择器思维入门 · 25min抓取边界:Robots 协议、法律与伦理入门 · 20minPython 爬虫工具链与环境搭建入门 · 20min 02-静态抓取核心requests 与会话管理核心 · 25minHTML 解析实战:BeautifulSoup 与 lxml核心 · 30minXPath 与选择器进阶核心 · 25min结构化数据抽取:JSON 接口与数据定位核心 · 25min分页、列表与详情页的采集模式核心 · 30min数据清洗与持久化:CSV、SQLite 与 Parquet核心 · 25min 03-动态页面与反爬动态渲染识别:浏览器渲染与 JS 数据核心 · 20min浏览器自动化:Playwright 与 Selenium核心 · 30min抓包分析:DevTools 与 mitmproxy核心 · 25min接口参数逆向:加密与签名还原思路进阶 · 30min反爬机制全景图:从 UA 到风控核心 · 25min礼貌抓取:限速、重试与超时工程核心 · 25min 04-规模化与工程化Scrapy 架构与核心组件进阶 · 30min异步并发:asyncio 与 aiohttp进阶 · 30min代理池与 IP 资源管理进阶 · 20min调度、去重与断点续抓进阶 · 30min分布式爬虫与任务队列进阶 · 25min监控、日志与告警进阶 · 20min 05-数据挖掘与分析从爬取到挖掘:数据管线与指标设计核心 · 20min数据质量:去重、校验与清洗管线核心 · 25min文本挖掘入门:分词、词频与 TF-IDF进阶 · 30min时序与对比分析:价格与销量洞察进阶 · 30min无监督挖掘:聚类与关联规则进阶 · 30min可视化与数据报告核心 · 20min 06-实战案例案例:电商商品数据采集全流程进阶 · 35min案例:评论与舆情文本采集分析进阶 · 30min案例:公开数据源采集(政府/学术/API)核心 · 20min采集项目工作流:需求、设计与维护核心 · 25min 07-进阶与前沿验证码与人机验证:类型、触发与止损边界前沿 · 20min浏览器指纹与自动化检测原理前沿 · 25min无头集群与云原生抓取前沿 · 25minLLM 时代的数据采集:智能抽取与合规趋势前沿 · 20min