用AI制作网络爬虫,能做到什么程度,又在哪里遇到困难?

最近考虑数据收集的人们最常问的问题。这是一个正确的问题。如果对ChatGPT或Claude说“请帮我编写一个Python代码,从这个网站收集产品名称和价格”,几分钟内就会得到相当合理的爬虫代码。几年前可能需要开发者的帮助。

95
用AI制作网络爬虫,能做到什么程度,又在哪里遇到困难?

"ChatGPT可以做吗?"

最近考虑数据收集的人们最常问的问题。这是一个正确的问题。如果向ChatGPT或Claude说“请帮我编写Python代码来从这个网站收集产品名称和价格”,那么在几分钟内就会得到一个相当合理的爬虫代码。几年前,这是必须雇佣开发人员来完成的工作。

因此,这篇文章并不是在说“AI做不到”。它确实有明确的适用范围,如果在这个范围内,最好自己动手。但是一旦实际运行起来,就会遇到障碍点,从哪里开始使用AI,以及从哪里开始出现其他问题,如果事先了解这一点,就可以大大减少试错。


先承认可以做到的事情

对于结构简单的网站,小规模,一次性收集的工作,AI编写的爬虫代码就足够了。即使不懂代码,也可以与AI交流并逐步修正,而且实际上几乎没有成本。实际上,我们的博客中也有一篇介绍如何使用ChatGPT创建爬虫机器人的文章。

AI擅长的工作总结如下。

  • 爬虫代码编写本身 — 包括查找选择器、解析逻辑、保存到Excel
  • 给出错误消息后的代码修改建议
  • 收集的数据整理和处理代码

到目前为止,在AI时代,这些工作确实变得容易了。问题在于,在爬取中,代码只占了一半不到。


五个障碍点

1. 阻止是基础设施问题,而不是代码问题

AI生成的代码通常使用基本的请求方式。在小型网站上可以运行,但在像大型电商、门户、社交网络等有强烈机器人检测的网站上很快就会被阻止。IP被封锁,出现验证码,页面空白。

要突破这一点,需要的不是更好的代码,而是基础设施。动态IP(住宅代理)、浏览器指纹管理、验证码应对 — 这些都不是通过代码生成就能解决的,而是需要花钱和运营的领域。即使对AI说“帮我绕过阻止”,没有基础设施是无法执行的。

2. 静默故障 — AI无法察觉到已经出现故障

网站界面结构会突然改变,此时爬虫可能会停止运行或开始堆积空值。当您要求AI修复时,它会帮您修复,但它不会首先意识到出现故障

在运营中,这一点是令人恐惧的。在两周内收集数据为空,直到月底分析时才首次发现的情况 — 过去的数据无法恢复。自动收集需要监控数据量、异常检测、通知等监控系统,这些不属于爬虫代码之外的系统。

3. 在复杂结构中,最终需要人工调试

在动态页面中,每次滚动都会加载内容,登录会话,嵌套框架等结构中,AI编写的代码的成功率会急剧下降。如果您不断地在“可以”和“不可以”之间挣扎,与AI来回数十次后,从某一时刻开始,需要懂得阅读代码的人。如果您从不懂编程开始,这里是实质性的障碍。

4. 定期、大规模收集需要系统而不是脚本

要稳定地每天收集数万条数据,需要调度、失败时重试、去重、值格式验证等设备。一次性运行的脚本和每天运行的收集系统是不同的东西。AI可以编写这些组件的代码,但组装和运营仍然是人类的工作。

5. 法律判断和责任AI无法承担

收集对象是否为公开数据,是否涉及个人信息、版权问题,是否存在条款和服务器负载方面的问题 — AI可以提供参考意见,但判断和责任在用户身上。特别是如果计划将收集的数据用于业务,这一点在开始之前就需要澄清。


从另一个角度看:AI降低了开发成本,因此价值转移到了运营

贯穿五个障碍的结论是一个。AI降低了爬虫开发成本,而爬取的实际成本越来越多地转移到了运营。 阻止应对基础设施、故障检测和修复、数据质量管理 — 过去这些就很困难,但现在开发变得更容易后,差距变得更加明显。

因此,我们也使用AI。如果爬虫因网站更改而停止运行,AI会首先分析原因并提出修复方案,然后由人员审核并应用。AI加快了修复速度,但AI的工作是监控体系、基础设施、审核流程。AI独立和运营体系内的AI — 结果的差异就在这里。


因此,何时直接使用AI,何时委托他人

情况 建议
简单网站,小规模,一次性 直接使用AI — 足够且成本最低
有人处理代码,目标不苛刻 AI辅助 + 自己尝试运营也值得
阻止严重的网站(大型电商、SNS等) 基础设施至关重要 — 这是收集服务领域
每天/每周重复收集,数据与业务相关 监控和维护至关重要 — 这是收集服务领域

简而言之:一次性运行的代码交给AI,需要持续运行的收集交给运营体系 是合理的选择。


常见问题

Q. 如果AI进步了,它会自动运行爬虫操作吗?
修复速度将持续加快。我们也朝着这个方向利用AI。但是阻止应对基础设施(代理等)和“检测到故障”的体系是与代码生成不同的问题,随着AI的改进,这些运营基础的重要性会增加。

Q. 如果在使用AI制作过程中遇到困难,那时委托别人可以吗?
可以。实际上有很多人这样做,而且已经尝试过的人往往要求更明确,因此进展更快。如果您分享尝试过的代码或遇到的障碍,这将有助于审查。

Q. 委托别人与使用AI制作有何不同?
就爬虫开发而言,差距正在缩小。差异在于运营 — 阻止应对基础设施、监控和自动通知、网站更改时的免费维修、数据质量验证都包含在服务中。


推荐阅读

  • 使用ChatGPT创建Coupang爬虫机器人:从搜索结果中提取产品信息
  • 为什么大型企业数据团队放弃自己爬取数据?
  • 如何开始网页数据提取 — 从手动复制到收集服务的4种方法比较
  • 爬虫订阅 vs 单独计费 — 不比较一年总成本(TCO)就会亏本

立即开始

尝试使用AI遇到困难了吗?告诉我们目标网站和遇到的问题,我们将免费为您诊断可收集性和适当方法。

联系我们进行爬取

Comments

Add Comment

Your email won't be published and will only be used for reply notifications.

继续阅读

Get notified of new posts

We'll email you when 해시스크래퍼 기술 블로그 publishes new content.

Your email will only be used for new post notifications.