合法与合规使用
Proxy 改变你的流量表面上来自哪里,但它们不改变你被允许做什么。本页涵盖伴随 proxy 和自动化访问而来的法律与伦理问题,好让你能做出站得住脚的选择。这是一般性信息,不是法律建议;法律因司法辖区和具体情形而异,因此请就你自己的情况咨询有资质的律师。
一个 proxy 不是许可
IP 地址是一个技术细节。它不授予任何权利。经由一个 proxy 路由,并不使你免于遵守一个站点的服务条款、它的访问控制,或在你和该站点运营所在地适用的法律。在自动化一个站点之前值得问的那些问题,无论有没有 proxy 都是一样的:
- 该站点的服务条款是否允许自动化访问?
- 你是在绕过一个访问控制(一次登录、一道付费墙、一个封锁),还是在读取公开数据?
- 你的请求速率和总量,是服务器能够在不受损害的情况下承受的吗?
- 你是否在收集个人数据,你是否有合法依据这样做?
服务条款与访问控制
许多站点在其条款中禁止自动化访问,无论 IP 如何。专门使用轮换 proxy 来破解一个速率限制、一个地理限制或一个账户限制,正是那种把条款违反变成法院可能会更严肃对待之事的绕过行为。
有两个主题贯穿于值得了解的判例法之中(作为背景,而非建议):
- 公开数据对受限数据。 抓取公开可得、无需认证的数据,通常比访问登录或你不得不设法绕过的访问控制之后的数据,会被更宽容地对待。
- 影响很重要。 即便是公开数据,如果抓取得足够激进以至于给服务器造成负担或降低其性能,也曾被当作一种独立的损害来对待。数量和效果都算数,而不只是你在技术上是否进去了。
个人数据与隐私
如果你收集关于可识别的人的数据,隐私法就会适用。在 GDPR 下,一个 IP 地址是个人数据,处理它需要一个合法依据;对抓取而言,那通常意味着正当利益(legitimate-interests)依据,它要求权衡你的目的与个人的权利。类似的制度在别处也存在(加州的 CCPA,以及其他)。
在实践中,有两条原则承载了大部分的分量:
- 数据最小化。 只收集你确实需要的字段。一个页面暴露了邮箱或地址,并不意味着你就应该存储它们。
- 目的与保留。 为数据持有一个明确的理由,并在那个理由结束时删除它。
负责任地抓取
在合法之外,有几个习惯能让你的自动化避免造成损害:
- 尊重
robots.txt和任何公布的爬取指引,哪怕一个 proxy 会让你能够无视它。 - 给自己限速。 在请求之间加入延迟,并对每个站点限制并发,好让你永远不去接近一个 proxy 池会让你能够产生的负载。
- 收到
429就退避。 当一个服务器返回 Too Many Requests 时,放慢速度,而不是轮换到一个新的 IP 硬闯过去。 - 在适当时可被识别。 对研究或监测,一个带联系地址的描述性 User-Agent,比伪装成一个浏览器更站得住脚。
站得住脚的立场
当 proxy 的使用是透明的(你能解释为什么)、必要的(一个真实的理由,比如监测或研究)、相称的(方法与需要相匹配,而不过度)和合规的(在适用法律和站点条款之内)时,它最容易被辩护。
何时应当远离
某些目标带有足够高的风险,以至于 proxy 完全是错误的工具:银行和金融站点、政府门户、医疗健康系统(那里像 HIPAA 这样的数据保护规则带有严厉的处罚),以及受其自身政策管辖的企业内部系统。对这些,使用经授权的访问或一个官方 API,而不是伪装成正常用户的自动化。
非法律建议
本页是面向工程师的一般性信息,不是法律建议。一项特定活动是否合法,取决于司法辖区、站点,以及你所做之事的细节。在部署可能带来法律后果的自动化之前,请咨询有资质的法律顾问。
相关内容
- Proxy:在 Pydoll 中配置 proxy。
- 网络基础 和 HTTP/HTTPS proxy:流量实际是如何流动的。
- RFC 1928(SOCKS5)和 RFC 9298(CONNECT-UDP):代理背后的协议规范。