"ChatGPT可以做吗?"
最近考虑数据收集的人们最常问的问题。这是一个正确的问题。如果向ChatGPT或Claude说“请帮我编写Python代码来从这个网站收集产品名称和价格”,那么在几分钟内就会得到一个相当合理的爬虫代码。几年前,这是必须雇佣开发人员来完成的工作。
因此,这篇文章并不是在说“AI做不到”。它确实有明确的适用范围,如果在这个范围内,最好自己动手。但是一旦实际运行起来,就会遇到障碍点,从哪里开始使用AI,以及从哪里开始出现其他问题,如果事先了解这一点,就可以大大减少试错。
先承认可以做到的事情
对于结构简单的网站,小规模,一次性收集的工作,AI编写的爬虫代码就足够了。即使不懂代码,也可以与AI交流并逐步修正,而且实际上几乎没有成本。实际上,我们的博客中也有一篇介绍如何使用ChatGPT创建爬虫机器人的文章。
AI擅长的工作总结如下。
- 爬虫代码编写本身 — 包括查找选择器、解析逻辑、保存到Excel
- 给出错误消息后的代码修改建议
- 收集的数据整理和处理代码
到目前为止,在AI时代,这些工作确实变得容易了。问题在于,在爬取中,代码只占了一半不到。
五个障碍点
1. 阻止是基础设施问题,而不是代码问题
AI生成的代码通常使用基本的请求方式。在小型网站上可以运行,但在像大型电商、门户、社交网络等有强烈机器人检测的网站上很快就会被阻止。IP被封锁,出现验证码,页面空白。
要突破这一点,需要的不是更好的代码,而是基础设施。动态IP(住宅代理)、浏览器指纹管理、验证码应对 — 这些都不是通过代码生成就能解决的,而是需要花钱和运营的领域。即使对AI说“帮我绕过阻止”,没有基础设施是无法执行的。
2. 静默故障 — AI无法察觉到已经出现故障
网站界面结构会突然改变,此时爬虫可能会停止运行或开始堆积空值。当您要求AI修复时,它会帮您修复,但它不会首先意识到出现故障。
在运营中,这一点是令人恐惧的。在两周内收集数据为空,直到月底分析时才首次发现的情况 — 过去的数据无法恢复。自动收集需要监控数据量、异常检测、通知等监控系统,这些不属于爬虫代码之外的系统。
3. 在复杂结构中,最终需要人工调试
在动态页面中,每次滚动都会加载内容,登录会话,嵌套框架等结构中,AI编写的代码的成功率会急剧下降。如果您不断地在“可以”和“不可以”之间挣扎,与AI来回数十次后,从某一时刻开始,需要懂得阅读代码的人。如果您从不懂编程开始,这里是实质性的障碍。
4. 定期、大规模收集需要系统而不是脚本
要稳定地每天收集数万条数据,需要调度、失败时重试、去重、值格式验证等设备。一次性运行的脚本和每天运行的收集系统是不同的东西。AI可以编写这些组件的代码,但组装和运营仍然是人类的工作。
5. 法律判断和责任AI无法承担
收集对象是否为公开数据,是否涉及个人信息、版权问题,是否存在条款和服务器负载方面的问题 — AI可以提供参考意见,但判断和责任在用户身上。特别是如果计划将收集的数据用于业务,这一点在开始之前就需要澄清。
从另一个角度看:AI降低了开发成本,因此价值转移到了运营
贯穿五个障碍的结论是一个。AI降低了爬虫开发成本,而爬取的实际成本越来越多地转移到了运营。 阻止应对基础设施、故障检测和修复、数据质量管理 — 过去这些就很困难,但现在开发变得更容易后,差距变得更加明显。
因此,我们也使用AI。如果爬虫因网站更改而停止运行,AI会首先分析原因并提出修复方案,然后由人员审核并应用。AI加快了修复速度,但AI的工作是监控体系、基础设施、审核流程。AI独立和运营体系内的AI — 结果的差异就在这里。
因此,何时直接使用AI,何时委托他人
| 情况 | 建议 |
|---|---|
| 简单网站,小规模,一次性 | 直接使用AI — 足够且成本最低 |
| 有人处理代码,目标不苛刻 | AI辅助 + 自己尝试运营也值得 |
| 阻止严重的网站(大型电商、SNS等) | 基础设施至关重要 — 这是收集服务领域 |
| 每天/每周重复收集,数据与业务相关 | 监控和维护至关重要 — 这是收集服务领域 |
简而言之:一次性运行的代码交给AI,需要持续运行的收集交给运营体系 是合理的选择。
常见问题
Q. 如果AI进步了,它会自动运行爬虫操作吗?
修复速度将持续加快。我们也朝着这个方向利用AI。但是阻止应对基础设施(代理等)和“检测到故障”的体系是与代码生成不同的问题,随着AI的改进,这些运营基础的重要性会增加。
Q. 如果在使用AI制作过程中遇到困难,那时委托别人可以吗?
可以。实际上有很多人这样做,而且已经尝试过的人往往要求更明确,因此进展更快。如果您分享尝试过的代码或遇到的障碍,这将有助于审查。
Q. 委托别人与使用AI制作有何不同?
就爬虫开发而言,差距正在缩小。差异在于运营 — 阻止应对基础设施、监控和自动通知、网站更改时的免费维修、数据质量验证都包含在服务中。
推荐阅读
- 使用ChatGPT创建Coupang爬虫机器人:从搜索结果中提取产品信息
- 为什么大型企业数据团队放弃自己爬取数据?
- 如何开始网页数据提取 — 从手动复制到收集服务的4种方法比较
- 爬虫订阅 vs 单独计费 — 不比较一年总成本(TCO)就会亏本
立即开始
尝试使用AI遇到困难了吗?告诉我们目标网站和遇到的问题,我们将免费为您诊断可收集性和适当方法。




