爬取配置里,池大小常被忽略,但影响很大。池太小IP很快被耗光或封掉;池太大则白花钱。下面讲代理池大小怎么算、怎么配,以及为什么大规模爬取里移动代理池往往比数据中心池更省事。

什么是代理池
代理池是一组可供轮换使用的代理IP地址集合。爬取系统从池中取出代理,完成请求后将其放回或替换为新代理。代理池的主要指标包括:
- 池大小:可用代理IP的总数量
- 活跃率:当前可正常使用的代理占总数的比例
- 轮换速度:IP更换的频率
- 地理分布:IP来自的国家和地区分布
- 协议类型:HTTP、SOCKS5或其他协议的比例
代理池管理系统负责维护池的健康状态,定期检测每个代理的可用性,自动移除失效代理并补充新代理。好的池管理应能在不中断任务的情况下动态换代理。
中大规模爬取常把代理池和任务队列(Celery或RQ)绑在一起,做并发分配和负载均衡。
代理池大小的影响因素
确定代理池大小需要综合考虑以下关键因素:

- 目标网站的反爬强度:Google、Facebook等高防护网站需要更大的代理池;小型网站可以用较小的池应对
- 每日请求总量:预计每天发送的总请求数直接决定IP消耗速率
- 单IP每日承载上限:不同平台对同一IP的请求容忍度差异很大
- 并发线程数:同时运行的爬取线程越多,需要的代理池越大
- IP冷却时间:被封锁或触发限制的IP需要多长时间才能重新使用
- 地理位置要求:是否需要来自特定国家/地区的IP
反爬越强,池子往往要越大,质量要求也更高。
计算所需代理数量
实用计算公式:
最小池大小 = (每日请求总量 / 单IP日承载量)× 安全系数
以具体场景为例:
- 每日爬取目标:50,000个页面
- 目标网站(中等防护):单IP每日承载约500次请求
- 安全系数:1.5(为封锁和失效留出余量)
- 计算结果:(50,000 / 500) × 1.5 = 150个代理
电商、社交这类高防护站,单IP日承载可能只有100到200次,池子要明显放大。移动代理单IP承载通常比数据中心高50%到100%,信任度更高。
并发因素同样重要:如果你运行20个并发线程,池中至少需要有20个可用代理,建议保持3到5倍的冗余,即60到100个代理。
轮换策略与池大小的关系
轮换策略会直接拉动池大小:
- 每请求轮换:每次请求使用不同IP,需要最大的代理池,但防封效果最好
- 每会话轮换:一个会话(通常是一组相关页面)使用同一IP,池大小需求中等
- 定时轮换:每隔固定时间(如10分钟)轮换一次IP,适合长时间持续爬取
- 触发式轮换:遇到封锁或错误时才轮换,节省代理资源但响应较慢
多数场景用「按间隔轮换 + 异常立即切换」就够了:比如每50次请求换一次,遇封立刻换。代理消耗和防封之间比较好折中。
Proxy Poland支持通过API动态获取新IP,轮换延迟通常在3秒以内,适合对轮换速度有要求的爬取任务。
移动代理池vs数据中心代理池
同样池大小,移动池和数据中心池差距很明显:
- 封锁率:移动代理的封锁率通常比数据中心代理低60%到80%
- 恢复速度:移动IP被限制后,通过轮换获得新IP后可立即使用;数据中心IP被封后可能需要几天才能恢复
- 池利用率:移动代理池的有效利用率更高,同等规模的池能支撑更多请求
- 成本效益:虽然移动代理单价更高,但由于效率优势,实际每成功请求的成本差距并不大
盯Amazon、Instagram、LinkedIn这类站时,50个移动代理往往顶得过200个数据中心代理。高防护站会主动识别并封数据中心IP段。
池健康监控
池健康要盯这些指标:
- 成功率:每个代理IP的请求成功率,低于70%的代理应被替换
- 响应时间:平均响应时间超过阈值(如5秒)的代理需要检查
- 错误类型分布:区分网络超时(可重试)和封锁错误(需轮换IP)
- 地理位置漂移:确保IP的实际位置与预期一致
建议每5到10分钟自动探活,标失效并补新代理。监控思路可参考代理速度测试工具。
实际配置建议
按规模可参考的池配置:
- 小规模(每天1万次以下):10到20个移动代理,每会话轮换策略
- 中规模(每天1万到10万次):20到100个移动代理,混合轮换策略
- 大规模(每天10万次以上):100个以上移动代理,每请求轮换+地理分布
不同规模套餐见Proxy Poland定价页面。套餐含无限带宽和完整API,方便做自动池管理。
2026年8月针对波兰电商 listing 的实用经验:每个移动IP配8-12个worker、按请求轮换时,20-30个4G地址、配合合理退避,一天大约能撑25-40k请求而不至于验证码陡增。若一小时内单IP封禁占比超过约15%,先拉长冷却或降并发,再考虑加IP。只把池子做大却不控节奏,新地址会以同样速度被烧掉。先连续记一周成功率和封禁曲线,再决定扩容幅度,通常比凭感觉一次加一倍更稳。
大规模采集离不开靠谱代理池。Proxy Poland提供真实4G/5G调制解调器移动代理,带宽不限,支持完整API。详见定价页面。
波兰 marketplace 价格监控场景:3 个店铺、每 15 分钟刷新目录、合计约 6 千商品卡。每 IP 挂 10 个 worker、按请求轮换时,24 个 4G 地址通常能撑满一天,验证码不高于日常基线,前提是按小时统计的封禁占比低于约 15%。一旦封禁占比抬头,先把冷却时间加 30-60 秒,或把并发降到 6-8 个 worker;只加 IP、不调请求节奏,只会更快烧掉新地址。池子看起来更大,中午照样可能见顶。
截至2026年8月,波兰轻量 SERP 排名监控:每 IP 4-6 个 worker、每小时刷新 50-80 个词、按请求轮换。8-12 个 4G 地址通常能撑满一天且验证码不陡增,前提是按小时统计的单 IP 封禁占比低于约 10%。这比商品卡采集更省池子,因为负载更轻。若成功率连续三小时掉超过 5 个百分点,先把冷却加 20-40 秒,再考虑加 IP。只扩池不调节奏,新地址仍会以同样速度烧掉。
2026 年用波兰 4G 做轻量 SERP 监控,合理起点大约是每 5-8 个 worker 配 1 个 IP,每小时 40-60 个词,429 后冷却 25-35 秒。单个 sticky 出口上超过约 12 个 worker 时,成功率往往先掉,池子还没耗尽。先别急着再买 10 个 IP:把冷却加 15 秒跑满三小时,再对比 success。很多时候不必扩池就能回升;只加地址不调节奏,新 IP 仍会以同样速度烧掉。
2026 年用波兰 4G 拉政务 PDF 与注册页时,合理起点大约是每 3-4 个 worker 配 1 个 IP,每小时 20-30 份文档,403 后冷却 40-60 秒。6-10 个 4G 地址通常能撑满一个工作日,前提是按小时统计的单 IP 封禁占比低于约 12%。若 PDF 超时连续三小时升高,先给 fetch 预算加约 15 秒,再考虑加 IP。只扩池、节奏不变,新地址仍会在中午前烧光。
2026年8月比价场景:一条爬虫同时打 Allegro、Ceneo 和 OLX。按目标主机定池,不要按 worker 数。每个 marketplace 配 1 个 sticky 4G IP,搜索结果再加 2 个轮换 IP。如果 5xx 来自源站(店铺页本身挂了),再买 8 个 IP 也没用。先把该主机从队列拿掉 20-30 分钟,再改池子大小,避免把新地址烧在源站故障上,扩池解决不了源站宕机。
截至2026年8月:盯单个目标站点,别只数 IP,网段和运营商都要看。12 个 4G 地址分在 Plus、Orange、Play 三家波兰网络上,成功率通常比同一 ASN 里的 20 个地址更稳。若一小时内超过 70% 的请求出自同一个 /24 前缀,先把出口打散,再考虑加 IP。池子里已有 15 个以上地址却不足三家运营商时,按小时统计的封禁占比往往比同等数量、摊到三四张网上的池子更早抬头。只往同一网段加地址,有效池几乎不变。
2026年8月新场景。夜间盯一家波兰网店的库存,不是整站目录爬取。固定名单 80-150 个 SKU,只轮询 in_stock 标志,每 5-8 分钟一次。该源站的商品卡用 1 个 sticky 4G IP,listing 再加 2 个轮换 IP。3-5 个地址通常能撑过夜班,前提是遇到 429 后冷却 45-90 秒。别按三条 marketplace、24 个地址的爬虫来扩这个池。成功率掉了,先把 SKU 之间的间隔拉长,再考虑加 IP。
截至2026年8月:定池按 sitemap 增量,不要按目录里的 URL 总数。用 1 个 sticky 4G IP,每小时拉一次 sitemap.xml 或 sitemap_index。若 lastmod 显示 24 小时内只有 200-400 处变更,只跑增量时通常 2-4 个 4G 地址、每 IP 1-2 个 worker 就够。全量 recrawl 所有 URL 是另一项任务,那时再回到 8-12 个 IP。增量和全量混在同一批出口上,就算地址看起来很多,池子也撑不到早上。
2026年8月新场景是盯 Otomoto 上一条已保存的筛选,而不是整站目录。一条筛选通常只有 120-250 条车源。列表页每 8-12 分钟用 2 个轮换 4G IP 刷新。详情页固定走 1 个 sticky 出口。3-4 个地址通常能撑满一个工作日,前提是遇到 429 后冷却 50-80 秒。这个池不要和 Allegro 或 Ceneo 的爬虫混用。一小时内若超过 10% 的详情页返回 403,先拉长 ID 之间的间隔,再考虑加 IP。
