Un RAG contenant uniquement des documents internes est incomplet - Raison pour laquelle les données de marché externes sont nécessaires pour l'IA et comment gérer leur fraîcheur

Créer un chatbot RAG à partir de documents internes peut être très utile au début. Il répond rapidement aux questions des employés sur les règles de congé, les avantages sociaux et les manuels de procédures. Cependant, après un certain temps, les cadres posent cette question : "Et donc, qu'est-ce que cette IA apporte aux ventes ?"

161
Un RAG contenant uniquement des documents internes est incomplet - Raison pour laquelle les données de marché externes sont nécessaires pour l'IA et comment gérer leur fraîcheur
Sommaire

Les règles répondent bien, mais l'IA ne répond pas aux affaires

Créer un chatbot RAG pour les documents internes peut être assez utile au début. Les règles de congé, les avantages sociaux, le manuel des opérations - il répond facilement aux questions des employés. Mais après un certain temps, des questions comme celles-ci viennent des cadres. "Alors, que fait cette IA pour nos revenus?"

C'est là que ça coince. Le RAG qui ne contient que des documents internes ne connaît que les affaires internes de l'entreprise. Ce dont vous avez besoin pour prendre des décisions commerciales, comme ce que les concurrents ont offert cette fois-ci, les réactions aux nouveaux produits de notre part, les rumeurs qui circulent sur le marché - la plupart des éléments nécessaires à l'évaluation des affaires sont des données externes, et le RAG n'en contient aucune.

Cet article ne traite pas de la façon de 'connecter' le RAG, mais de 'ce qu'il faut y mettre, et comment le maintenir frais'. Comme il existe déjà de nombreux guides sur l'intégration technique, nous abordons le sujet du point de vue des planificateurs.


Les données externes transforment le RAG en outil commercial

Même avec le même RAG, la capacité à répondre aux questions varie en fonction de ce que vous y mettez.

Données incluses Questions auxquelles on peut répondre
Seulement des documents internes "Quelles sont les règles de remboursement des frais de déplacement?"
+ Prix et produits des concurrents "Où nos prix se situent-ils par rapport à ceux de nos concurrents?"
+ Avis clients et VOC "Sur quels aspects nos produits récents reçoivent-ils le plus de critiques?"
+ Marché et actualités "Y a-t-il eu des problèmes liés à notre secteur cette semaine?"

Plus vous descendez dans le tableau, plus les questions qui intéressent les cadres sont posées, et pour y répondre, vous avez besoin de données externes. La valeur du RAG dépend non pas du modèle, mais de la portée des données que vous y mettez.


Le vrai problème est la 'fraîcheur'

Si vous décidez d'inclure des données externes, le piège suivant est la fraîcheur. Les règles internes changent tous les quelques mois, mais les prix des concurrents changent quotidiennement et les avis s'accumulent chaque heure. Laisser des données externes obsolètes dans le RAG peut rapidement devenir un problème.

  • Une IA qui répond avec un prix datant de 3 mois donnera une réponse incorrecte en toute confiance - c'est plus risqué que de ne pas savoir.
  • Si des réponses obsolètes apparaissent une ou deux fois, les opérationnels perdent confiance en l'IA, et le service en exploitation en subit les conséquences.

C'est pourquoi un RAG avec des données externes doit être conçu comme une 'opération de mise à jour' et non un simple 'projet d'insertion'. La clé est la mise à jour continue, pas seulement le chargement initial.


Concevoir la fraîcheur en fonction de la 'fréquence de collecte'

La fraîcheur ne signifie pas simplement "mettre à jour fréquemment", mais déterminer la fréquence nécessaire en fonction de la nature des données.

Diviser la fréquence en fonction de la nature des données

  • Choses qui changent rapidement (prix, stocks, classements) : nécessitent une mise à jour au moins une fois par jour
  • Moyennes (avis, articles) : une mise à jour toutes les quelques heures à quelques jours
  • Choses qui changent lentement (informations sur l'entreprise, catalogues) : une mise à jour toutes les semaines à tous les mois

Déléguer la mise à jour au pipeline

Il est essentiel de mettre en place une structure qui collecte, nettoie et met à jour automatiquement la base de données vectorielle selon un calendrier prédéfini. Un processus manuel ne durera que quelques semaines.

Détecter l'obsolescence

Enregistrez l'heure de la dernière mise à jour dans les données, et recevez une notification si la mise à jour est interrompue. Afficher "à quel moment les données ont été collectées" comme justification de la réponse renforce également la confiance.

Une fois ces trois éléments en place, la fraîcheur devient une mesure gérable et le RAG reste pertinent avec le temps.


Les données brutes non raffinées ne peuvent pas être directement intégrées dans le RAG

Une dernière chose. Si vous poussez les données brutes collectées directement dans la base de données vectorielle, la qualité de la recherche en souffrira. Les doublons pollueront les réponses, les valeurs avec des formats variés ne pourront pas être comparées, et les avis multilingues ne seront pas pris en compte dans les recherches.

C'est pourquoi un niveau de raffinement entre la collecte et le RAG est nécessaire. En éliminant les doublons, en standardisant les formats, et en structurant les données brutes avec des analyses AI telles que l'analyse de sentiment, la classification et la traduction, la recherche devient plus précise et le filtrage devient possible. Hashscraper ajoute cette couche de raffinement et d'analyse aux données collectées avant de les transmettre via une API ou une base de données, ce qui permet de les intégrer directement dans le RAG. La fréquence de collecte régulière devient alors la fréquence de fraîcheur du RAG.


Questions fréquemment posées

Q. La connexion de données externes n'est-elle pas un problème technique? Pourquoi la planification est-elle prioritaire?
La connexion elle-même est résolue par les guides existants. Cependant, même avec une technologie parfaite, des réponses obsolètes peuvent apparaître si vous ne définissez pas correctement 'ce qu'il faut inclure et à quelle fréquence'. La conception de la fraîcheur est une décision de planification, pas une question technique.

Q. À quelle fréquence devons-nous mettre à jour les données?
Cela dépend de la nature des données. Les éléments qui changent fréquemment comme les prix et les classements nécessitent une mise à jour quotidienne, tandis que les éléments plus stables comme les informations sur l'entreprise nécessitent une mise à jour hebdomadaire ou mensuelle. En planifiant des cycles pour chaque catégorie, vous pouvez équilibrer les coûts et la fraîcheur.

Q. Pouvons-nous intégrer directement les données collectées dans notre base de données vectorielle?
C'est possible après le raffinement. Recevoir des données avec des doublons supprimés, des formats standardisés et des analyses AI telles que l'analyse de sentiment ajoutée, puis les transmettre via une API ou une base de données pour les charger dans la base de données vectorielle est une pratique courante.


Articles complémentaires

  • Guide pratique pour connecter les données de web scraping au RAG
  • Pourquoi les PoC d'IA s'arrêtent-ils aux démos - Le problème n'est pas le modèle mais la chaîne d'approvisionnement des données
  • Ajouter une analyse AI aux avis collectés - Comment lire les retours clients avec l'analyse de sentiment, la classification et la traduction
  • Comment les données de web scraping deviennent des décisions

Commencez dès maintenant

Vous avez besoin de données externes à intégrer dans le RAG? Si vous nous indiquez quelles données vous avez besoin, à quelle fréquence vous souhaitez les maintenir fraîches, nous pouvons concevoir ensemble la structure de collecte, de raffinement et de mise à jour.

Demander une consultation sur l'utilisation des données

Commentaires

Ajouter un commentaire

Votre e-mail ne sera pas publié et servira uniquement à vous avertir des réponses.

Continuer la lecture

Get notified of new posts

We'll email you when 해시스크래퍼 기술 블로그 publishes new content.

Your email will only be used for new post notifications.