如何从网络收集并清洗 LLM 微调训练数据集——胜出的不是爬得多的团队,而是筛得好的团队

决定自建 sLLM 的团队最先做的事,大多是“爬取”。他们抓取数百万个页面,炫耀文本容量,并宣布“语料库 확보完成”。而当他们把这些语料输入模型的那一刻,模型就开始说些奇怪的话。“订阅”“Cookie”

13
如何从网络收集并清洗 LLM 微调训练数据集——胜出的不是爬得多的团队,而是筛得好的团队
目录

决定自建 sLLM 的团队,最先做的事通常是“爬取”。抓取数百万页面,炫耀文本容量,然后宣布“语料库已 확보”。而当他们把那批语料送进模型的瞬间,模型开始说些奇怪的话:“订阅”、“您是否允许 Cookie”、“查看更多相关商品”。

模型会按你喂给它的内容学习。喂它广告文案,它就会学习广告文案。

语料库不是采矿,而是冶炼。不是挖得多,而是剔除得好。

微调的成败不在 GPU 上分出高下。真正的分水岭在于将数据送入模型之前,决定“什么不送进去”的精炼工作台。

TL;DR

  • 微调语料库的重点不是“收集”,而是“精炼”。网页文本堆和可训练的原始文本不是同一种东西。
  • 若将噪声(广告·菜单·重复内容)原样送入模型,模型会学习样板文本,并产生过度采样偏差。等于把训练预算花在广告文案上。
  • 许可证·隐私审查必须在训练“之前”完成。送入模型后再移除,实际上是不可能的。

目录

  1. 为什么“抓取的文本”不是语料库
  2. 精炼管线的 9 个步骤
  3. 3 种获取方式对比
  4. 5 项自检
  5. FAQ
  6. 结论
  7. 立即开始

为什么“抓取的文本”不是语料库

先统一定义。

训练语料库,是指从网页抓取的文本中剔除样板文本、删除重复内容,并完成许可证与隐私审查后保留下来的“精炼原始文本”。 它不是矿石,而是冶炼后的金属。

样板文本,是指所有不属于正文的重复元素。 页头、侧边栏、页脚、Cookie 横幅、“相关文章”、“订阅”按钮文本。人眼未必会注意到,但在爬虫看来它们全都是文本。

问题在于,单个网页中真正正文所占的比例比想象中更小。其余全是不断重复的外壳。如果将这些外壳原样送入模型,会发生什么?

模型会最有把握地复现它在数据中最常见的模式。但“订阅”会在每个网站、每个页面反复出现。真正需要学习的领域知识每页只出现一次,外壳却出现上万次。结果,模型不会成为领域专家,而会变成“页脚朗读机”。

模型会按你喂给它的内容学习。连“订阅”按钮也会学进去。

精炼管线的 9 个步骤

收集只是第 1 步。其余 8 步决定语料库的质量。

  1. 收集 — 确定目标域名·URL,并获取原始 HTML。到这里仅仅是开始。
  2. 去除样板文本 — 剔除菜单·广告·Cookie 横幅·重复 UI 文本,只保留正文。这是精炼的第一道火。
  3. 去除近重复内容 — 不仅删除完全相同的文档,也删除“几乎相同”的文档。复制同一篇文章的镜像网站、仅模板不同的商品描述都会在这里被筛掉。
  4. 格式标准化(JSONL) — 将杂乱无章的文本统一为训练管线可直接读取的每行一篇文档(JSONL)结构。
  5. 许可证/版权审查 — 确认来源是否允许用于训练。这件事不能放到后面,必须在这里做。
  6. 隐私信息清洗(PII 移除) — 剔除姓名·联系方式·身份证号码等个人识别信息。一旦送入模型,就无法回头。
  7. 毒性/质量过滤 — 过滤有害表述、损坏的编码、无意义文本。
  8. 领域均衡 — 调整比例,避免特定来源·主题被过度采样。若一个网站占据语料库的一半,模型就会模仿那个网站。
  9. Token 规模估算 — 到这里才第一次衡量规模。必须以“精炼之后”为准。

这里最常犯的错误是第 9 步。如果在精炼之前计算 Token,就会得到连外壳都算进去的虚高数字。宣称有 100 亿 Token,结果剔除外壳后只剩 30 亿,这种事确实会发生。

Token 要在精炼完成后再计算。此前的数字是连外壳一起计算的虚数。

而且绝不要推迟第 5 步·第 6 步的顺序。许可证与隐私问题必须在训练“之前”处理。信息一旦融入模型权重,就无法只挑出某个特定句子删除。事后移除并不是困难,而是除了重新训练以外,实际上没有答案。

许可证与隐私问题要在训练前完成。送入模型后就无法移除。

3 种获取方式对比

如何获得语料库,大致有三条路径。每种方式都有坦诚的优势与弱点。

维度 开放数据集 自行收集·精炼 托管式语料库交付
规模 大(公开大规模数据) 取决于团队能力 按需求规模定制
领域适配 低(通用)
许可证审查 因数据集而异 自行承担 审查完成后交付
重复/PII 清洗 因数据集而异 自行承担(搭建管线) 清洗完成
维护负担 高(运营·更新全部) 低(委托)

开放数据集是很好的起点。它们公开且规模大。不过,它们未必恰好适合我们的领域,许可证与精炼水平也因数据集而异,因此仍留下“验证”这一课题。

自行收集·精炼在领域适配方面最强。因为我们可以抓取想要的网站,并控制抓取深度。但代价是,必须亲自搭建并运行上述 9 步管线。大多数团队会在第 2 步·第 3 步·第 6 步崩溃。

托管式语料库交付,是接收从收集到许可证审查均已完成的精炼语料库的方式。它同时兼顾领域适配与较低维护负担,但相应也会产生委托成本。韩国本土的数据收集服务生态在不同方式上各有差异;若想更全面地了解这张地图,请参考韩国数据收集服务对比 — 2026 年的真实地图

Hashscraper 属于第三种方式。依托超过 5,000 个韩国网站的收集经验与覆盖 195 个国家的代理基础设施,以 99.7% 的准确率获取原始文本,并完成上述 9 步精炼后交付。之所以在服务超过 500 家企业的过程中保持 0 起法律问题,是因为我们将许可证审查不是放在“之后”,而是纳入管线之中。

5 项自检

请用以下问题检查你目前准备中的语料库。

  • [ ] 我们是否实际剔除了语料库中的广告·菜单·Cookie 横幅文本
  • [ ] 是否连“几乎相同”的文档(镜像·复制粘贴·模板)也完成了去重
  • [ ] 是否在训练“之前”完成了许可证·版权审查
  • [ ] 是否清洗了个人识别信息,且没有遗漏未删除的信息
  • [ ] 是否按“精炼之后”的标准重新计算了 Token 规模

若少于 3 项打勾,那么你现在要送入模型的不是语料库,而是一堆外壳。

FAQ

Q. 如何从网页收集并精炼 LLM 微调训练数据集?
A. 收集只是开始,重点是精炼。获取原始 HTML 后,应依次进行样板文本去除 → 近重复内容去除 → JSONL 格式标准化 → 许可证审查 → 隐私信息清洗 → 毒性/质量过滤 → 领域均衡 → Token 规模估算,才能成为可用于训练的“精炼原始文本”。其中许可证与隐私审查必须在训练前完成。

Q. 只要多抓一些,不就是好语料库吗?
A. 不是。决定质量的不是数量,而是精炼水平。若将噪声原样送入模型,模型会反复学习广告文案,并产生对特定来源过度采样的偏差。规模应在精炼完成后再计算。

Q. 许可证或隐私信息不能以后再移除吗?
A. 实际上不可能。信息一旦融入模型权重,就无法只挑出特定句子删除,除了重新训练外没有其他答案。因此,这两项审查必须置于管线前段。

Q. 精炼后的语料库制作完成后,应该如何管理和使用?
A. 制作语料库后,如何将其实际应用于公司内部业务并持续更新,是另一个不同的话题。我们将在另一篇介绍内部知识利用的文章中单独讨论。

结论

微调项目失败的节点通常不在 GPU 面前。而是在此之前,将连外壳在内的全部内容一股脑送入模型的那一刻。语料库的胜负不取决于采矿量,而取决于精炼质量。获胜的不是抓得更多的团队,而是剔除得更好的团队。

核心有三点:精炼才是重点;送入噪声,模型就会学习噪声;许可证与隐私问题必须在训练前完成。只要守住这三点,就不会将训练预算浪费在广告文案上。

不要把训练预算花在广告文案上。那笔预算应该花在领域知识上。

立即开始

我们将协助您确定适合自身领域的网站,并获取经上述 9 步精炼的语料库。超过 5,000 个韩国网站的收集经验、覆盖 195 个国家的代理、99.7% 准确率、0 起法律问题。我们将许可证审查纳入管线后再交付。新注册用户可获得 5 万积分。

咨询爬取·监控服务

若想将收集的数据扩展为通知·响应闭环,请继续阅读监控不是收集,而是通知 — 用价格·声誉数据构建响应闭环

评论

发表评论

您的邮箱不会公开,仅用于回复通知。

继续阅读

Get notified of new posts

We'll email you when 해시스크래퍼 기술 블로그 publishes new content.

Your email will only be used for new post notifications.