Wie sammelt und bereinigt man Trainingsdatensätze für LLM-Fine-Tuning aus dem Web? Nicht das Team, das am meisten scrapt, gewinnt, sondern das, das am besten aussortiert.

Teams, die beschließen, ein eigenes sLLM zu entwickeln, beginnen meist mit „Crawling“. Sie scrapen Millionen von Seiten, prahlen mit der Textmenge und erklären: „Korpus gesichert.“ Doch sobald sie diesen Korpus ins Modell laden, beginnt es, seltsame Dinge zu sagen. „Abonnieren“, „Cookies …

12
Wie sammelt und bereinigt man Trainingsdatensätze für LLM-Fine-Tuning aus dem Web? Nicht das Team, das am meisten scrapt, gewinnt, sondern das, das am besten aussortiert.
Inhaltsverzeichnis

Das Erste, was ein Team, das sich entschlossen hat, ein eigenes sLLM zu entwickeln, meistens tut, ist „Crawling“. Es sammelt Millionen von Seiten, prahlt mit dem Textvolumen und verkündet: „Korpusbeschaffung abgeschlossen.“ Und in dem Moment, in dem dieses Korpus in das Modell eingespeist wird, beginnt das Modell, seltsame Dinge zu sagen. „Abonnieren“, „Möchten Sie Cookies akzeptieren?“, „Weitere verwandte Produkte anzeigen“.

Das Modell lernt, womit man es füttert. Füttert man es mit Werbetexten, lernt es Werbetexte.

Ein Korpus wird nicht geschürft, sondern veredelt. Es geht nicht darum, viel zu fördern, sondern gut auszusortieren.

Über Erfolg oder Misserfolg beim Fine-Tuning entscheidet nicht die GPU. Es entscheidet sich am Bereinigungstisch vor dem Training, an dem festgelegt wird, „was nicht eingespeist werden soll“.

TL;DR

  • Beim Fine-Tuning-Korpus ist nicht die „Sammlung“ der Kern, sondern die „Bereinigung“. Ein Haufen Webtexte und Quelltexte für das Training sind zwei verschiedene Dinge.
  • Werden Stördaten (Werbung·Menüs·Duplikate) unverändert eingespeist, lernt das Modell Boilerplate und entwickelt Verzerrungen durch Überrepräsentation. Das bedeutet, das Trainingsbudget für Werbetexte auszugeben.
  • Lizenz- und Datenschutzprüfungen müssen vor dem Training abgeschlossen sein. Nach dem Einspeisen etwas zu entfernen, ist praktisch unmöglich.

Inhaltsverzeichnis

  1. Warum „gescrapter Text“ kein Korpus ist
  2. Die 9 Schritte der Veredelungspipeline
  3. Vergleich von 3 Beschaffungswegen
  4. 5 Fragen zur Selbstdiagnose
  5. FAQ
  6. Fazit
  7. Jetzt direkt starten

Warum „gescrapter Text“ kein Korpus ist

Beginnen wir mit der Definition.

Ein Trainingskorpus ist ein „bereinigter Quelltext“, der übrig bleibt, nachdem Boilerplate aus im Web gescrapten Texten entfernt, Duplikate gelöscht sowie Lizenzen und personenbezogene Daten geprüft wurden. Es ist kein Rohmaterial, sondern veredeltes Metall.

Boilerplate umfasst sämtliche wiederkehrenden Elemente, die nicht zum Hauptinhalt gehören. Header, Sidebars, Footer, Cookie-Banner, „Verwandte Beiträge“, Button-Texte wie „Abonnieren“. Für Menschen sind sie kaum sichtbar, für Crawler jedoch allesamt Text.

Das Problem ist folgendes: Der tatsächliche Hauptinhalt einer Webseite macht einen geringeren Anteil aus, als man denkt. Der Rest ist wiederkehrende Hülle. Was passiert, wenn diese Hülle unverändert eingespeist wird?

Das Modell reproduziert die Muster, die es in den Daten am häufigsten gesehen hat, mit dem größten Selbstvertrauen. Doch „Abonnieren“ wiederholt sich auf jeder Website und auf jeder Seite. Das Domänenwissen, das eigentlich gelernt werden soll, erscheint nur einmal pro Seite, während die Hülle zehntausendmal vorkommt. Das Ergebnis: Das Modell wird kein Domänenexperte, sondern ein „Footer-Vorleser“.

Das Modell lernt, womit man es füttert. Es lernt sogar den „Abonnieren“-Button.

Die 9 Schritte der Veredelungspipeline

Die Sammlung ist nur Schritt 1. Die übrigen 8 Schritte bestimmen die Qualität des Korpus.

  1. Sammlung — Ziel-Domains·URLs festlegen und Quell-HTML beschaffen. Bis hierhin ist es nur der Anfang.
  2. Boilerplate-Entfernung — Menüs·Werbung·Cookie-Banner·wiederkehrende UI-Texte entfernen und nur den Hauptinhalt behalten. Der erste Schmelzvorgang der Veredelung.
  3. Entfernung von Near-Duplicates — Nicht nur exakt gleiche Dokumente, sondern auch „fast gleiche“ Dokumente entfernen. Mirror-Websites mit kopierten Artikeln und Produktbeschreibungen, die sich nur im Template unterscheiden, werden hier herausgefiltert.
  4. Formatnormalisierung(JSONL) — Ungeordnete Texte in eine einheitliche Struktur aus einer Zeile pro Dokument(JSONL) überführen, die die Trainingspipeline direkt lesen kann.
  5. Lizenz-/Urheberrechtsprüfung — Prüfen, ob die Quelle für das Training verwendet werden darf. Das muss hier geschehen, nicht später.
  6. Scrubbing personenbezogener Daten(PII-Entfernung) — Personenbezogene Identifikationsdaten wie Namen·Kontaktdaten·Sozialversicherungsnummern entfernen. Was einmal eingespeist wurde, lässt sich nicht zurückholen.
  7. Toxizitäts-/Qualitätsfilterung — Schädliche Ausdrücke, fehlerhafte Kodierungen und bedeutungslose Texte herausfiltern.
  8. Domänen-Balancing — Anteile anpassen, damit bestimmte Quellen·Themen nicht überrepräsentiert werden. Wenn eine Website die Hälfte des Korpus ausmacht, ahmt das Modell diese Website nach.
  9. Ermittlung des Token-Umfangs — Erst hier wird der Umfang gemessen. Unbedingt auf Basis von „nach der Bereinigung“.

Der häufigste Fehler passiert bei Punkt 9. Zählt man Tokens vor der Bereinigung, handelt es sich um eine Scheinzahl einschließlich der Hülle. Es kommt tatsächlich vor, dass man mit 10 Milliarden Tokens prahlt und nach dem Entfernen der Hülle feststellt, dass nur 3 Milliarden übrig sind.

Zähle Tokens erst nach Abschluss der Bereinigung. Jede Zahl davor ist eine Scheinzahl, die auch die Hülle mitzählt.

Und verschieben Sie die Schritte 5·6 keinesfalls nach hinten. Lizenzen und personenbezogene Daten müssen vor dem Training verarbeitet werden. Informationen, die einmal in Modellgewichten aufgegangen sind, lassen sich nicht durch gezieltes Entfernen einzelner Sätze herauslösen. Nachträgliche Entfernung ist nicht nur schwierig, sondern praktisch nur durch erneutes Training möglich.

Lizenzen und personenbezogene Daten müssen vor dem Training abgeschlossen sein. Nach dem Einspeisen lassen sie sich nicht mehr entfernen.

Vergleich von 3 Beschaffungswegen

Es gibt drei Wege, ein Korpus zu beschaffen. Jeder hat ehrliche Stärken und Schwächen.

Dimension Offene Datensätze Eigene Sammlung·Bereinigung Lieferung eines verwalteten Korpus
Umfang Groß(öffentlich verfügbare große Datenmengen) Abhängig von den Teamfähigkeiten Auf den gewünschten Umfang zugeschnitten
Domänenanpassung Gering(allgemein) Hoch Hoch
Lizenzprüfung Je nach Datensatz unterschiedlich Eigene Verantwortung Nach abgeschlossener Prüfung geliefert
Duplikat-/PII-Bereinigung Je nach Datensatz unterschiedlich Eigene Verantwortung(Pipeline-Aufbau) Bereinigt geliefert
Wartungsaufwand Gering Hoch(Betrieb·Aktualisierung vollständig) Gering(Auslagerung)

Offene Datensätze sind ein hervorragender Ausgangspunkt. Sie sind öffentlich verfügbar und umfangreich. Allerdings passen sie nicht exakt zu unserer Domäne, und Lizenz- sowie Bereinigungsniveau unterscheiden sich von Datensatz zu Datensatz, sodass die Aufgabe der „Validierung“ bleibt.

Eigene Sammlung·Bereinigung bietet die stärkste Domänenanpassung. Schließlich können wir genau die Websites scrapen, die wir wollen, und zwar in der gewünschten Tiefe. Dafür müssen wir jedoch die oben beschriebene 9-Schritte-Pipeline selbst aufbauen und betreiben. Hier scheitern die meisten Teams an Schritt 2·3·6.

Bei der Lieferung eines verwalteten Korpus erhalten Sie ein bereinigtes Korpus, bei dem von der Sammlung bis zur Lizenzprüfung alles abgeschlossen ist. Domänenanpassung und geringer Wartungsaufwand werden kombiniert, allerdings entstehen entsprechend Kosten für die Auslagerung. Die Landschaft koreanischer Datensammlungsdienste unterscheidet sich je nach Ansatz; wenn Sie diese Karte umfassender betrachten möchten, lesen Sie den Artikel Vergleich koreanischer Datensammlungsdienste — Die echte Karte von 2026.

Hashscraper gehört zum dritten Ansatz. Auf Basis von Erfahrung bei der Sammlung von über 5.000 koreanischen Websites und einer Proxy-Infrastruktur in 195 Ländern beschafft Hashscraper Quelltexte mit einer Genauigkeit von 99,7 %, bereinigt sie durch alle oben genannten 9 Schritte und liefert sie aus. Der Grund, warum wir bei der Zusammenarbeit mit über 500 Unternehmen 0 Rechtsprobleme verzeichnen, ist, dass wir die Lizenzprüfung nicht „später“, sondern direkt in die Pipeline integriert haben.

5 Fragen zur Selbstdiagnose

Prüfen Sie Ihr derzeit vorbereitetes Korpus anhand der folgenden Punkte.

  • [ ] Haben wir Werbe·Menü·Cookie-Banner-Texte tatsächlich aus unserem Korpus entfernt?
  • [ ] Haben wir auch „fast gleiche“ Dokumente(Mirror·Kopien·Templates) dedupliziert?
  • [ ] Haben wir Lizenz·Urheberrechtsprüfungen vor dem Training abgeschlossen?
  • [ ] Haben wir personenbezogene Identifikationsdaten gescrubbt, und sind keine nicht entfernten Daten übrig?
  • [ ] Haben wir den Token-Umfang auf Basis von „nach der Bereinigung“ erneut gezählt?

Wenn weniger als 3 Punkte abgehakt sind, ist das, was Sie jetzt einspeisen wollen, kein Korpus, sondern ein Haufen Hüllen.

FAQ

Q. Wie sammelt und bereinigt man LLM-Fine-Tuning-Trainingsdatensätze aus dem Web?
A. Die Sammlung ist nur der Anfang; der Kern ist die Bereinigung. Nach der Beschaffung von Quell-HTML müssen Boilerplate-Entfernung → Near-Duplicate-Entfernung → JSONL-Formatnormalisierung → Lizenzprüfung → Scrubbing personenbezogener Daten → Toxizitäts-/Qualitätsfilterung → Domänen-Balancing → Ermittlung des Token-Umfangs erfolgen, damit daraus ein „bereinigter Quelltext“ für das Training wird. Insbesondere Lizenz- und Datenschutzprüfungen müssen unbedingt vor dem Training abgeschlossen sein.

Q. Ist ein gutes Korpus nicht einfach eines, das man in großen Mengen scrapt?
A. Nein. Nicht die Menge, sondern der Bereinigungsgrad bestimmt die Qualität. Werden Stördaten unverändert eingespeist, lernt das Modell wiederholt Werbetexte und entwickelt Verzerrungen durch die Überrepräsentation bestimmter Quellen. Der Umfang sollte erst nach Abschluss der Bereinigung gemessen werden.

Q. Kann man Lizenzen oder personenbezogene Daten nicht später entfernen?
A. Das ist praktisch unmöglich. Informationen, die einmal in Modellgewichten aufgegangen sind, lassen sich nicht gezielt Satz für Satz entfernen; außer erneutem Training gibt es keine Lösung. Deshalb müssen beide Prüfungen am Anfang der Pipeline stehen.

Q. Wie verwaltet und nutzt man ein bereinigtes Korpus nach der Erstellung?
A. Die Frage, wie das Korpus nach seiner Erstellung tatsächlich in interne Arbeitsabläufe eingebunden und aktualisiert wird, ist ein anderes Thema. Dies behandeln wir separat in einem Artikel über die Nutzung internen Wissens.

Fazit

Fine-Tuning-Projekte scheitern gewöhnlich nicht vor der GPU. Sie scheitern davor, in dem Moment, in dem die gesamte Hülle unverändert in das Modell geschoben wird. Ein Korpus wird nicht durch die Fördermenge, sondern durch die Qualität der Veredelung entschieden. Nicht das Team, das viel gescrapt hat, gewinnt, sondern das Team, das gut aussortiert hat.

Entscheidend sind drei Punkte: Bereinigung ist der Kern, das Einspeisen von Stördaten führt dazu, dass das Modell Stördaten lernt, und Lizenzen sowie personenbezogene Daten müssen vor dem Training abgeschlossen sein. Allein durch die Einhaltung dieser drei Punkte verschwenden Sie Ihr Trainingsbudget nicht für Werbetexte.

Geben Sie Ihr Trainingsbudget nicht für Werbetexte aus. Dieses Budget sollte für Domänenwissen eingesetzt werden.

Jetzt direkt starten

Wir begleiten Sie von der Auswahl geeigneter Websites für Ihre Domäne bis zum Erhalt eines durch die oben genannten 9 Schritte bereinigten Korpus. Erfahrung bei der Sammlung von über 5.000 koreanischen Websites, Proxys in 195 Ländern, 99,7 % Genauigkeit, 0 Rechtsprobleme. Wir liefern mit einer in die Pipeline integrierten Lizenzprüfung. Bei Neuanmeldung erhalten Sie 50.000 Credits.

Anfrage zu Crawling·Monitoring

Wie Sie gesammelte Daten zu einem Alarm·Reaktionskreislauf erweitern, erfahren Sie im Artikel Monitoring bedeutet nicht Sammlung, sondern Benachrichtigung — Einen Reaktionskreislauf mit Preis- und Reputationsdaten schaffen.

Kommentare

Kommentar hinzufügen

Deine E-Mail-Adresse wird nicht veröffentlicht und nur für Antwortbenachrichtigungen verwendet.

Weiterlesen

Get notified of new posts

We'll email you when 해시스크래퍼 기술 블로그 publishes new content.

Your email will only be used for new post notifications.