kp-004
抓取边界:Robots 协议、法律与伦理
前置知识
本文基于模型知识整理,为通用性科普而非法律意见;涉商业决策请咨询专业律师。
一句话定义
合规抓取的三层约束:技术层尊重 robots 协议,法律层不碰个人信息与受保护数据,行为层不干扰目标系统正常运行。
为什么重要
爬虫是国内已有司法判例触及的领域——违反用户意愿抓取个人信息、绕过技术措施、高频访问致瘫系统等行为,可能引发民事、行政乃至刑事责任。合规不是选择题:它是本库一切动手练习的前置条件。
前置知识
kp-001。
核心概念
- robots.txt:站点在
/robots.txt公布的抓取意愿声明(允许谁、抓哪些路径、频率建议)。 - ToS(服务条款):许多站点在条款中禁止自动化访问,违反可能构成违约。
- 个人信息:能识别到特定自然人的信息(手机号、身份证、住址、生物特征等)。国内受《个人信息保护法》(PIPL)规制,欧盟同类为 GDPR。
- 技术措施:登录墙、付费墙、验证码、加密接口等;绕过它们通常不被认可。
- 公共数据 vs 授权数据:政府公开数据、学术开放数据集通常有明确授权;平台数据多属平台商业资产。
原理与机制
robots.txt 的典型语法(对爬虫作者而言这是「先读再抓」的约定):
User-agent: *
Disallow: /private/ ← 所有爬虫不得抓 /private/ 路径
Disallow: /search
Crawl-delay: 5 ← 建议间隔 5 秒
Sitemap: https://example.com/sitemap.xml
一条实用的自检链(动手前逐条过):
1. 数据是否含个人信息? → 含:默认不采,或有合法依据(授权/合同)
2. 是否需要登录/付费才能看? → 是:默认不采(越过身份边界)
3. robots.txt 是否明确禁止? → 禁止:不采或先取得授权
4. 采集频率是否会增加对方负担? → 评估并限速(见 kp-017)
5. 采来做什么? → 转售原样数据/冒充来源 = 高风险;统计分析结论 = 低风险
实例或案例
该做:抓取政府招投标公开公告做行业分析;抓取电影公评数据(公开、无个人信息)做情感趋势研究,并注明来源、控制频率。
不该做:绕过验证码批量抓取手机号;破解付费专栏接口转售内容;以每秒百次请求压垮小型站点。
常见误区
- 误区一:「公开可访问 = 可以随意采集」。 页面公开不代表可以批量复制牟利,也不代表其中嵌入的个人信息可以被收集。
- 误区二:robots.txt 是法律。 它是行业礼仪与意愿声明,不是法律文本本身;但无视它会被作为「明知故犯」的证据。
- 误区三:匿名代理能规避责任。 责任主体不变;大规模使用代理池对抗风控反而加重「故意」情节。
自测题
- 目标站 robots.txt 对你的 UA 写了 Disallow,你该怎么办?
答:默认停止采集该路径;若业务必须,走官方授权/数据合作渠道,而不是硬抓。
- 抓到含手机号的公开页面数据,可以直接入库吗?
答:不可以。手机号属个人信息,收集需合法性依据;应只保留聚合统计或做脱敏。
- 采集行为里「最危险」的三件事是什么?
答:碰个人信息、绕技术措施(破解登录/验证码/加密接口用于越权获取)、高频访问干扰对方系统。
与其他知识点的关系
kp-017 把「礼貌」变成工程参数;kp-016、kp-034 的对抗性话题必须先以本篇画定的边界为前提。
延伸阅读
www.robotstxt.org 的协议说明;《个人信息保护法》官方全文(优先读「处理规则」与「法律责任」两章)。