kp-004

抓取边界:Robots 协议、法律与伦理

入门 ≈ 20 分钟 合规robots法律伦理个人信息

前置知识

本文基于模型知识整理,为通用性科普而非法律意见;涉商业决策请咨询专业律师。

一句话定义

合规抓取的三层约束:技术层尊重 robots 协议,法律层不碰个人信息与受保护数据,行为层不干扰目标系统正常运行。

为什么重要

爬虫是国内已有司法判例触及的领域——违反用户意愿抓取个人信息、绕过技术措施、高频访问致瘫系统等行为,可能引发民事、行政乃至刑事责任。合规不是选择题:它是本库一切动手练习的前置条件。

前置知识

kp-001。

核心概念

  • robots.txt:站点在 /robots.txt 公布的抓取意愿声明(允许谁、抓哪些路径、频率建议)。
  • ToS(服务条款):许多站点在条款中禁止自动化访问,违反可能构成违约。
  • 个人信息:能识别到特定自然人的信息(手机号、身份证、住址、生物特征等)。国内受《个人信息保护法》(PIPL)规制,欧盟同类为 GDPR。
  • 技术措施:登录墙、付费墙、验证码、加密接口等;绕过它们通常不被认可。
  • 公共数据 vs 授权数据:政府公开数据、学术开放数据集通常有明确授权;平台数据多属平台商业资产。

原理与机制

robots.txt 的典型语法(对爬虫作者而言这是「先读再抓」的约定):

User-agent: *
Disallow: /private/     ← 所有爬虫不得抓 /private/ 路径
Disallow: /search
Crawl-delay: 5          ← 建议间隔 5 秒
Sitemap: https://example.com/sitemap.xml

一条实用的自检链(动手前逐条过):

1. 数据是否含个人信息? → 含:默认不采,或有合法依据(授权/合同)
2. 是否需要登录/付费才能看? → 是:默认不采(越过身份边界)
3. robots.txt 是否明确禁止? → 禁止:不采或先取得授权
4. 采集频率是否会增加对方负担? → 评估并限速(见 kp-017)
5. 采来做什么? → 转售原样数据/冒充来源 = 高风险;统计分析结论 = 低风险

实例或案例

该做:抓取政府招投标公开公告做行业分析;抓取电影公评数据(公开、无个人信息)做情感趋势研究,并注明来源、控制频率。
不该做:绕过验证码批量抓取手机号;破解付费专栏接口转售内容;以每秒百次请求压垮小型站点。

常见误区

  • 误区一:「公开可访问 = 可以随意采集」。 页面公开不代表可以批量复制牟利,也不代表其中嵌入的个人信息可以被收集。
  • 误区二:robots.txt 是法律。 它是行业礼仪与意愿声明,不是法律文本本身;但无视它会被作为「明知故犯」的证据。
  • 误区三:匿名代理能规避责任。 责任主体不变;大规模使用代理池对抗风控反而加重「故意」情节。

自测题

  1. 目标站 robots.txt 对你的 UA 写了 Disallow,你该怎么办?

答:默认停止采集该路径;若业务必须,走官方授权/数据合作渠道,而不是硬抓。

  1. 抓到含手机号的公开页面数据,可以直接入库吗?

答:不可以。手机号属个人信息,收集需合法性依据;应只保留聚合统计或做脱敏。

  1. 采集行为里「最危险」的三件事是什么?

答:碰个人信息、绕技术措施(破解登录/验证码/加密接口用于越权获取)、高频访问干扰对方系统。

与其他知识点的关系

kp-017 把「礼貌」变成工程参数;kp-016、kp-034 的对抗性话题必须先以本篇画定的边界为前提。

延伸阅读

www.robotstxt.org 的协议说明;《个人信息保护法》官方全文(优先读「处理规则」与「法律责任」两章)。

相关知识点

学习进度