住宅代理与数据中心代理该怎么选?
从成本出发对比住宅代理与数据中心代理:检测机制到底如何运作、两类出口的单条数据成本各是多少,以及一套通常能把账单砍掉三分之二的分级策略。
这个问题几乎总是被表述成「哪种更好」,而这几乎总是问错了。住宅代理更难被检测,每 GB 大约贵五到十倍;数据中心代理极易被识别,但便宜。这两个事实都没告诉你该买什么,因为答案完全取决于:你的目标站到底会不会去查。
下面讲的是怎么判断,以及怎么不再为那些根本不需要住宅代理的请求付住宅代理的钱。
唯一真正的区别
两类代理转发字节的方式完全相同。区别在于信誉数据库对这个地址的判定。
住宅 IP 由消费级运营商分配给家庭。在所有公开的 IP 情报数据源中,它被归类为 residential(住宅)——和正在用家庭宽带阅读这篇文章的人属于同一类。数据中心 IP 分配给托管服务商,被归类为 hosting(托管),而且毫无歧义:地址分配记录是公开的。
就这些。数据包本身没有任何技术属性上的差别。你为住宅流量支付的全部溢价,买到的只有一样东西:查表时得到的不同答案。
这一点很重要,因为它恰好告诉你溢价什么时候值得付。目标站会查这张表,住宅代理就值;不查,你就是花钱买了个寂寞。
目标站实际上是怎么判断的
实践中我们看到目标站有四个档次的行为。
完全不检查。 文档站、开放数据门户、政府登记系统、大多数 B2B 目录、你自己的预发布环境。数据中心代理可以一直用下去。这类站点在整个互联网中的占比,比代理行业愿意承认的要大得多。
只做限速。 站点按 IP 计数请求并在阈值以上限速,但不在乎 IP 是什么类型。数据中心代理完全够用,你只需要足够多的地址和合理的请求节奏。
做信誉查询。 站点检查 IP 是否被归类为托管,然后封禁或抛出验证。这是住宅代理开始变成必需品的地方,大多数面向消费者的大型站点都在这一档。
完整行为分析。 IP 类型只是输入之一,还有 TLS 指纹、请求头顺序、鼠标轨迹和会话历史。住宅代理是必要但不充分条件;对其中最难的一批,动态移动代理是下一级选择。
你无法靠读资料判断某个目标站属于哪一档。判断方式是:用数据中心出口发一百个请求,然后对响应做分类。
要算「单条有效数据的成本」
每 GB 单价是账单上的数字;单条有效数据的成本才是真正重要的数字,而这两者会明显背离。
假设一个页面 180 KB,你需要抓 10 万个。
走数据中心代理、单价 $0.80/GB,整次抓取约 18 GB,花费约 14.40 美元——前提是每个请求都成功。走住宅代理、单价 $1.80/GB,同样的抓取约 32.40 美元。
现在假设目标站拒绝了 60% 的数据中心请求。那些被拒绝的响应你照样付费,而且重试还得用住宅代理。数据中心那部分仍然是 14.40 美元,加上 60% 的量用住宅重跑一遍的 19.44 美元,合计 33.84 美元——比直接上住宅还贵,而且延迟翻倍。
交叉点大约在数据中心成功率 45%。高于它,分级策略胜出;低于它,干脆跳过第一层。先测量,再据此设计架构。
分级策略
对于数据中心大部分时候能成功的目标,下面这个顺序能稳定产出最低的单条数据成本:
- 所有请求先走数据中心。 它是你最便宜也最快的出口。
- 按内容分类响应,不要只看状态码。 验证页返回的是 HTTP 200,会不声不响地污染你的数据集。可用的分类器见我们的 Python 轮换代理完整设置指南。
- 失败的请求重新排队到住宅出口。 不要在同一层重试;数据中心被拒过一次,再试还是会被拒。
- 给升级设上限。 往下两层就停,记录 URL 然后继续。除非目标价值很高,否则第三次在移动出口上的尝试很少能回本。
我们合作过的一个团队原本每月 4 TB 全部走住宅代理。做完分级之后,78% 的请求在数据中心层就成功了,月账单从约 7200 美元降到 2400 美元——数据条数相同,采集速度还更快。
什么情况下只能用住宅代理
有些场景可以跳过上面的分析直接下结论。
本地化内容。 如果你要以德国买家的视角看德国站点,就需要一个在零售商所用的数据库里归属德国的 IP。数据中心 IP 的地理归属指向机房,很多零售商会把它当作未分类流量并返回默认页面。
登录态会话。 任何涉及账号的流程,都不应该跑在「消费者账号从来不会使用的 IP 类型」上。哪怕站点本身允许,这种不一致也值得避免。这类场景下,静态 ISP 代理通常比轮换住宅更合适,因为地址保持不变。
广告验证。 伪装脚本专门识别数据中心 IP,用来返回落地页的合规版本。从机房出口验证,你看到的是广告主「应该在投」的东西,而不是实际在投的东西。
规模化的消费者平台。 大型社交与电商平台牢牢处在信誉查询档,不会向托管 IP 返回有意义的内容。
什么情况下数据中心明显更合适
反过来,有些场景用住宅代理就是浪费:
你自己的基础设施。 可用性监控、SSL 到期检查、针对自有系统的合成事务。根本没有需要隐藏的对象。
量大于隐蔽性。 抓取大型文档语料或开放数据集。字节数累积很快,而且没人在检查。
对延迟敏感的工作。 数据中心往返通常低于 100 毫秒;住宅出口经常是它的三到五倍,因为最后一跳是别人家的宽带。如果你要做数千次串行请求,这个差距会主导整体耗时。
首轮发现。 用数据中心低成本枚举 URL,再用住宅代理抓取真正重要的页面。
一套判断流程
与其抽象地选择,不如跑一遍这个流程:
- 从目标站挑 200 个有代表性的 URL。
- 以礼貌的速率通过数据中心出口抓取。记录每个响应的分类结果,而不只是状态码。
- 成功率高于 80%:数据中心作为主层,住宅处理剩余部分。
- 成功率在 45% 到 80% 之间:仍然分级,但要预期相当一部分会升级。
- 成功率低于 45%:直接上住宅,跳过那次注定浪费的首次尝试。
- 每月重跑一次测量。目标站会改变策略,而且通常不打招呼。
最后一步是团队最容易忽略的。一月份还接受数据中心流量的站点,三月份可能就加上了信誉检查,而唯一的症状是数据集在缓慢劣化。
对比总表
| 住宅代理 | 数据中心代理 | |
|---|---|---|
| 归类为 | 消费级运营商 | 托管服务商 |
| 常见价格 | $0.50–$5.00/GB | $0.50–$1.20/GB |
| 延迟 | 300–900 毫秒 | 40–120 毫秒 |
| 做信誉检查的目标 | 可用 | 被封 |
| 本地化内容 | 准确 | 经常出错 |
| 最佳定位 | 升级层与地域敏感任务 | 主层与大批量采集 |
对大多数团队来说,实际答案不是二选一,而是:数据中心优先、失败后升级到住宅,再加上每月一次的测量,确认这个比例还停留在你以为的位置。
关于作者
UUIProxy 数据工程负责人
加入 UUIProxy 之前,Daniel 为一家零售集团在九个市场负责价格情报业务。现在他大部分时间在帮助团队重构那些「成本增速快过数据量增速」的爬虫——办法通常是给出口分级、对响应做分类,而不是简单地买更多住宅流量。