La première chose que fait généralement une équipe qui décide de créer son propre sLLM, c'est le « crawling ». Elle ratisse des millions de pages, se vante du volume de texte, puis déclare : « Corpus acquis. » Et au moment où elle injecte ce corpus dans le modèle, celui-ci commence à dire des choses étranges : « S'abonner », « Acceptez-vous les cookies ? », « Voir plus de produits associés ».
Le modèle apprend ce qu'on lui donne à manger. Donnez-lui des textes publicitaires, il apprendra des textes publicitaires.
Un corpus ne s'extrait pas : il se raffine. L'important n'est pas d'en extraire beaucoup, mais de bien retirer ce qui doit l'être.
La réussite ou l'échec du fine-tuning ne se joue pas sur les GPU. Elle se joue, avant d'alimenter le modèle, sur la table de raffinage où l'on décide de « ce qu'on ne va pas y injecter ».
TL;DR
- Pour un corpus de fine-tuning, le cœur du sujet n'est pas la « collecte », mais le « raffinage ». Un tas de textes web et des textes sources destinés à l'entraînement sont deux choses différentes.
- Si vous injectez tels quels les bruits (publicités, menus, doublons), le modèle apprend le boilerplate et subit un biais de surreprésentation. C'est comme dépenser son budget d'entraînement en slogans publicitaires.
- L'examen des licences et des données personnelles doit être terminé 'avant' l'entraînement. Les retirer après coup est pratiquement impossible.
Sommaire
- Pourquoi le « texte récupéré » n'est pas un corpus
- Les 9 étapes du pipeline de raffinage
- Comparaison de 3 méthodes d'acquisition
- Autodiagnostic en 5 questions
- FAQ
- Conclusion
- Commencer dès maintenant
Pourquoi le « texte récupéré » n'est pas un corpus
Commençons par nous accorder sur la définition.
Un corpus d'entraînement est un « texte source raffiné » conservé après avoir retiré le boilerplate, supprimé les doublons et examiné les licences ainsi que les données personnelles dans les textes récupérés sur le web. Ce n'est pas du minerai brut, mais du métal raffiné.
Le boilerplate désigne l'ensemble des éléments répétitifs qui ne font pas partie du contenu principal. En-têtes, barres latérales, pieds de page, bannières de cookies, « articles associés », texte des boutons « S'abonner ». Ils sont invisibles à l'œil humain, mais pour un crawler, ce sont tous des textes.
Voici le problème. Sur une page web, la part réellement occupée par le contenu principal est plus faible qu'on ne le pense. Tout le reste n'est qu'une enveloppe répétitive. Que se passe-t-il si vous injectez cette enveloppe telle quelle ?
Le modèle reproduit avec le plus d'assurance les motifs qu'il a vus le plus souvent dans les données. Or, « S'abonner » se répète de site en site et de page en page. Les connaissances métier qu'il devrait réellement apprendre n'apparaissent qu'une fois par page, tandis que l'enveloppe apparaît dix mille fois. Au final, le modèle devient non pas un expert du domaine, mais un « lecteur de pieds de page ».
Le modèle apprend ce qu'on lui donne à manger. Il apprend même les boutons « S'abonner ».
Les 9 étapes du pipeline de raffinage
La collecte n'est que la première étape. Les 8 étapes restantes déterminent la qualité du corpus.
- Collecte — Définir les domaines et URL cibles, puis obtenir le HTML source. Ce n'est encore que le début.
- Suppression du boilerplate — Retirer les menus, publicités, bannières de cookies et textes d'interface répétitifs pour ne conserver que le contenu principal. Le premier feu du raffinage.
- Déduplication quasi exacte — Supprimer non seulement les documents strictement identiques, mais aussi les documents « presque identiques ». Les sites miroirs qui copient-collent le même article et les descriptions de produits dont seul le modèle diffère sont filtrés ici.
- Normalisation du format (JSONL) — Unifier les textes hétérogènes dans une structure JSONL, une ligne par document, directement lisible par le pipeline d'entraînement.
- Examen des licences/droits d'auteur — Vérifier si les sources peuvent être utilisées pour l'entraînement. Cela doit être fait ici, et non plus tard.
- Nettoyage des données personnelles (suppression des PII) — Retirer les informations permettant d'identifier une personne, telles que les noms, coordonnées et numéros d'identification. Une fois injectées, elles ne peuvent plus être récupérées.
- Filtrage de toxicité/qualité — Écarter les expressions nuisibles, les encodages corrompus et les textes dénués de sens.
- Équilibrage des domaines — Ajuster les proportions pour éviter qu'une source ou un sujet particulier soit surreprésenté. Si un seul site représente la moitié du corpus, le modèle imitera ce site.
- Estimation du volume de tokens — C'est seulement ici que l'on mesure l'ampleur du corpus. Toujours sur la base des données 'après raffinage'.
L'erreur la plus fréquente se situe à l'étape 9. Compter les tokens avant le raffinage produit un chiffre artificiellement gonflé, qui inclut aussi l'enveloppe. Il arrive réellement qu'une équipe se vante d'avoir 10 milliards de tokens, puis découvre qu'il n'en reste que 3 milliards après avoir retiré l'enveloppe.
Comptez les tokens une fois le raffinage terminé. Avant cela, le chiffre est artificiellement gonflé car il compte aussi l'enveloppe.
Et surtout, ne repoussez jamais les étapes 5 et 6 à plus tard. Les licences et les données personnelles doivent être traitées 'avant' l'entraînement. Une information intégrée une fois dans les poids du modèle ne peut pas être retirée en sélectionnant uniquement certaines phrases. La suppression a posteriori n'est pas simplement difficile : en pratique, il n'y a pas d'autre solution que le réentraînement.
Terminez les licences et les données personnelles avant l'entraînement. Après injection, elles ne peuvent plus être retirées.
Comparaison de 3 méthodes d'acquisition
Il existe trois voies pour obtenir un corpus. Chacune présente honnêtement ses forces et ses faiblesses.
| Axe | Jeux de données ouverts | Collecte et raffinage directs | Livraison de corpus gérée |
|---|---|---|---|
| Volume | Important (grands volumes publics) | Dépend des capacités de l'équipe | Adapté au volume requis |
| Adaptation au domaine | Faible (généraliste) | Élevée | Élevée |
| Examen des licences | Variable selon le jeu de données | À votre charge | Livré après examen complet |
| Déduplication/nettoyage des PII | Variable selon le jeu de données | À votre charge (construction du pipeline) | Raffinage inclus |
| Charge de maintenance | Faible | Élevée (exploitation et mises à jour complètes) | Faible (externalisée) |
Les jeux de données ouverts sont excellents comme point de départ. Ils sont publics et volumineux. Toutefois, ils ne correspondent pas forcément exactement à votre domaine, et leurs niveaux de licence et de raffinage varient considérablement d'un jeu de données à l'autre : il reste donc le devoir de « vérification ».
La collecte et le raffinage directs offrent l'adaptation au domaine la plus puissante. Vous pouvez explorer les sites que vous voulez, à la profondeur souhaitée. En contrepartie, vous devez construire et faire fonctionner vous-même le pipeline en 9 étapes ci-dessus. C'est là que la plupart des équipes échouent aux étapes 2, 3 et 6.
La livraison de corpus gérée consiste à recevoir un corpus raffiné, dont la collecte et l'examen des licences ont déjà été effectués. Elle permet à la fois une adaptation au domaine et une faible charge de maintenance, mais implique naturellement un coût d'externalisation. Le paysage des services coréens de collecte de données présente des caractéristiques différentes selon les méthodes ; si vous souhaitez voir cette carte dans son ensemble, consultez l'article Comparatif des services coréens de collecte de données — la vraie carte de 2026.
Hashscraper relève de la troisième méthode. Fort de son expérience de collecte sur plus de 5 000 sites coréens et de son infrastructure de proxys dans 195 pays, Hashscraper obtient les textes sources avec une précision de 99,7 %, puis les livre après avoir achevé les 9 étapes de raffinage ci-dessus. Si nous avons travaillé avec plus de 500 entreprises tout en maintenant 0 problème juridique, c'est parce que l'examen des licences est intégré au pipeline, et non traité « plus tard ».
Autodiagnostic en 5 questions
Appliquez les critères suivants au corpus que vous préparez actuellement.
- [ ] Avons-nous réellement retiré de notre corpus les textes publicitaires, menus et bannières de cookies ?
- [ ] Avons-nous dédupliqué jusqu'aux documents « presque identiques » (miroirs, copier-coller, modèles) ?
- [ ] Avons-nous terminé l'examen des licences et droits d'auteur 'avant' l'entraînement ?
- [ ] Avons-nous nettoyé les informations personnelles, sans qu'il reste d'éléments impossibles à supprimer ?
- [ ] Avons-nous recompté le volume de tokens sur la base des données 'après raffinage' ?
Si vous avez coché 3 cases ou moins, ce que vous vous apprêtez à injecter n'est pas un corpus, mais un tas d'enveloppes.
FAQ
Q. Comment collecter et raffiner sur le web un jeu de données d'entraînement pour le fine-tuning d'un LLM ?
R. La collecte n'est que le début ; le cœur du sujet est le raffinage. Après avoir obtenu le HTML source, il faut procéder dans l'ordre suivant : suppression du boilerplate → déduplication quasi exacte → normalisation au format JSONL → examen des licences → nettoyage des données personnelles → filtrage de toxicité/qualité → équilibrage des domaines → estimation du volume de tokens. C'est ainsi que l'on obtient des « textes sources raffinés » utilisables pour l'entraînement. Parmi ces étapes, l'examen des licences et des données personnelles doit impérativement être achevé avant l'entraînement.
Q. Ne suffit-il pas de récupérer beaucoup de données pour avoir un bon corpus ?
R. Non. Ce n'est pas la quantité, mais le niveau de raffinage qui détermine la qualité. Si vous injectez le bruit tel quel, le modèle apprendra de manière répétitive les slogans publicitaires et subira un biais de surreprésentation de certaines sources. Il convient de mesurer le volume une fois le raffinage terminé.
Q. Ne peut-on pas retirer les licences ou les données personnelles plus tard ?
R. C'est pratiquement impossible. Une information intégrée une fois aux poids du modèle ne peut pas être supprimée en sélectionnant uniquement certaines phrases ; hors réentraînement, il n'existe pas de solution. Ces deux examens doivent donc être placés au début du pipeline.
Q. Comment gérer et utiliser un corpus raffiné après sa création ?
R. Une fois le corpus créé, le fait de l'utiliser réellement dans les activités internes et de le mettre à jour constitue un sujet différent. Nous l'abordons séparément dans un article dédié à l'exploitation des connaissances internes.
Conclusion
Le point d'échec d'un projet de fine-tuning ne se situe généralement pas devant les GPU. Il survient avant cela, au moment où l'on injecte dans le modèle l'enveloppe entière. Un corpus se juge non au volume extrait, mais à la qualité du raffinage. Ce ne sont pas les équipes qui ont le plus récupéré qui gagnent, mais celles qui ont le mieux retiré l'inutile.
Trois principes sont essentiels : le raffinage est le cœur du sujet ; si vous injectez du bruit, le modèle apprend le bruit ; les licences et les données personnelles doivent être traitées avant l'entraînement. Respecter seulement ces trois principes suffit à éviter de gaspiller le budget d'entraînement en slogans publicitaires.
Ne dépensez pas votre budget d'entraînement en slogans publicitaires. Ce budget doit servir aux connaissances métier.
Commencer dès maintenant
Nous vous accompagnerons depuis le choix des sites adaptés à votre domaine jusqu'à la réception d'un corpus raffiné selon les 9 étapes ci-dessus. Expérience de collecte sur plus de 5 000 sites coréens, proxys dans 195 pays, précision de 99,7 %, 0 problème juridique. Nous intégrons l'examen des licences au pipeline avant livraison. Nous offrons 50 000 crédits aux nouveaux inscrits.
Nous contacter pour le crawling et le monitoring
La démarche consistant à étendre les données collectées vers une boucle d'alertes et de réponse se poursuit dans l'article Le monitoring n'est pas de la collecte, mais de l'alerte — créer une boucle de réponse avec les données de prix et de réputation.




