Bis die Crawling-Daten zur Entscheidungsfindung werden

Die meisten Anfragen zum Crawlen beginnen mit "Bitte sammeln Sie Daten von dieser Website". Aber wenn wir einige Monate später darüber sprechen, kommt oft heraus, dass die Daten täglich gut eintreffen, aber selten tatsächlich von der Organisation genutzt werden. Excel-Dateien stapeln sich im Ordner, und nur eine Person schaut sie sich an.

132
Bis die Crawling-Daten zur Entscheidungsfindung werden

Daten wurden gesammelt, aber nichts hat sich geändert

Anfragen zum Crawlen beginnen in der Regel mit "Bitte sammeln Sie Daten von dieser Website". Aber wenn wir ein paar Monate später darüber sprechen, kommt es häufig vor, dass obwohl die Daten täglich gut eintreffen, sie letztendlich nicht im Unternehmen genutzt werden. Excel-Dateien stapeln sich in Ordnern, und nur eine Person im Unternehmen öffnet sie.

Es gibt keine Daten, die nur zum Sammeln gedacht sind. Daten werden gesammelt, um Entscheidungen zu treffen, sei es Preisanpassungen, Produktverbesserungen oder das Herausfiltern von Verstößen. In diesem Artikel wird zusammengefasst, welche Schritte erforderlich sind, damit die mit dem Crawlen gesammelten Daten tatsächlich für Entscheidungen genutzt werden können und was fehlt, wenn in jedem Schritt die Daten nur zu "kostenlosem Sammeln" werden.


Vom Sammeln bis zur Entscheidungsfindung, vier Schritte

Um Crawldaten arbeitsfähig zu machen, müssen vier Schritte durchlaufen werden.

1. Sammeln

Dies ist der Schritt, bei dem regelmäßig die erforderlichen Elemente von der Zielseite abgerufen werden. Hierbei ist es wichtig, dass es sich um kontinuierliches Sammeln handelt, nicht nur um einmaliges Sammeln. Die Struktur der Website ändert sich unvorhersehbar, und auch die Sperrrichtlinien werden regelmäßig verschärft. Wenn das Sammeln für einige Tage unterbrochen wird, können die Daten für diesen Zeitraum nicht wiederhergestellt werden. Daher sind Wartung und Überwachung die Hälfte des Sammelprozesses.

2. Bereinigung und Strukturierung

Die gesammelten Rohdaten sind schwer direkt zu analysieren. Duplikate müssen entfernt, Felder von verschiedenen Websites angeglichen und Werte wie Preise und Daten in einem standardisierten Format zusammengeführt werden, um Daten aus verschiedenen Kanälen in einer Tabelle vergleichen zu können.

3. Analyse und Beurteilung

Wenn es sich um eine Menge handelt, die nicht von Menschen gelesen werden kann, ist ein Schritt erforderlich, bei dem die Maschine die Leseaufgabe übernimmt. Durch die Kombination von regelbasierten Filtern (Stichwörter, Schwellenwerte) und KI-Analysen (Sentiment-Analyse, Kategorisierung, Übersetzung, Risikobewertung) wird die Anzahl von Daten auf ein "kleines Subset, das von Menschen überprüft werden muss" reduziert.

4. Weitergabe und Nutzung

Dies ist der Schritt, bei dem die bereinigten Daten vor den Mitarbeitern landen, die damit arbeiten sollen. Vom Excel-Download über regelmäßige E-Mail-Versendungen, API- und Datenbankintegrationen bis hin zu Dashboards, die von verschiedenen Abteilungen gemeinsam genutzt werden - je nach Format variiert der Umfang, in dem die Daten im Unternehmen genutzt werden.

Wenn einer dieser vier Schritte fehlt, wird die Mühe des vorherigen Schritts nicht belohnt. Wenn nur gesammelt wird und keine Analyse erfolgt, stapeln sich Dateien, die niemand liest. Wenn jedoch eine Analyse durchgeführt wird, die Weitergabe jedoch schwach ist, endet es als Referenzmaterial für eine Person.


Wenn die Menge an Daten nicht von Menschen bewältigt werden kann, muss die Rolle geändert werden

Wenn wir uns ein Beispiel für das Risikomonitoring eines großen Lebensmittelunternehmens ansehen, wird diese Struktur deutlich. Ursprünglich durchsuchte ein Mitarbeiter fünf SNS-Kanäle manuell, um relevante Themen für das Unternehmen zu identifizieren. In einer menschlichen Lesestruktur war die Grenze bei fünf Kanälen erreicht, und selbst das war eher ein Überfliegen als ein vollständiges Lesen.

Heute sammelt das Unternehmen täglich Tausende von VOCs aus 30 SNS- und Community-Kanälen. Dies ist eine Erweiterung, die durch eine Änderung der Rolle und nicht durch die Erhöhung der Arbeitskräfte ermöglicht wurde. Maschinen übernehmen das Lesen, filtern nur Beiträge mit Risikosignalen heraus, und Menschen überprüfen diese ausgewählten wenigen Beiträge, um Maßnahmen zu ergreifen. Der Überwachungsbereich hat sich um das Sechsfache erhöht, aber die menschliche Aufgabe wurde eher zu einem "Urteil" als zu einer Ausweitung.

Die Analyse von VOCs folgt dem gleichen Muster. Es ist unmöglich, Tausende von Bewertungen, die auf sieben Länder verteilt sind, manuell zu übersetzen und zu lesen. Wenn jedoch für jede gesammelte Bewertung Spalten für Sentiment, Kategorie und Übersetzung hinzugefügt werden, kann ein Analyst sofort mit Fragen wie "Welche Beschwerden nehmen in welchem Land zu?" beginnen.

Ein gemeinsames Merkmal besteht darin, dass Maschinen lesen und Menschen entscheiden - diese Umverteilung der Rollen ist der Schlüssel dazu, Daten in Entscheidungen umzuwandeln.


In welchem Schritt befindet sich unsere Organisation?

Hier ist eine einfache Selbstüberprüfung.

  • Wissen Sie, wer letzte Woche wie oft auf die gesammelten Daten zugegriffen hat?
  • Werden die Daten gefiltert, um nur die "entscheidungsrelevanten" Informationen zu liefern, oder werden sie im Rohformat gespeichert?
  • Ist nur eine Person dafür verantwortlich, die Daten zu überprüfen, oder sind mehrere Personen an Entscheidungen beteiligt?
  • Wird bemerkt, wenn das Sammeln für einen Tag unterbrochen wird?

Wenn Sie bei den obigen Fragen ins Stocken geraten, liegt das Problem wahrscheinlich nicht beim Sammeln, sondern eher in einem der folgenden Schritte. Wenn Ihre Organisation bereits Daten sammelt, überprüfen Sie zuerst die Analyse und Weitergabe, bevor Sie das Sammeln erweitern. Wenn Sie jedoch gerade erst anfangen, legen Sie zuerst fest, wofür die Daten verwendet werden sollen, und entwerfen Sie dann rückwärts den Umfang des Sammelns, um Fehler zu minimieren.


Zusammenfassung

Das Crawlen ist nur der Einstieg in die Pipeline. Sammeln → Bereinigen → Analysieren → Weitergeben müssen folgen, damit Daten für Entscheidungen genutzt werden können.

Hashscraper bietet von der Sammlung bis zur Analyse und zum Dashboard die gesamte Pipeline für das Crawlen an. Wir übernehmen den Betrieb, die Wartung und Überwachung des Crawlers, sodass sich unsere Kunden auf Entscheidungen und Umsetzungen konzentrieren können.


Häufig gestellte Fragen

F: Ich sammle bereits Daten, kann ich nur die Analyse hinzufügen?
A: Ja, das ist möglich. Es handelt sich um das Hinzufügen von Analyse-Spalten wie Sentiment, Klassifizierung, Übersetzung zu den bereits gesammelten Daten, sodass nur die Analysephase hinzugefügt wird, ohne das Sammelsystem zu ändern.

F: Ist ein Dashboard unbedingt erforderlich?
A: Das hängt von der Größe der Organisation und dem Verwendungszweck ab. Wenn nur eine Person die Analyse durchführt, reichen oft Excel und E-Mails aus. Wenn jedoch mehrere Abteilungen dieselben Daten sehen müssen oder Trends überwachen müssen, ist ein Dashboard sehr effektiv.

F: Wo kann ich eine Beratung erhalten?
A: Teilen Sie uns mit, für welche Entscheidungen die Daten verwendet werden sollen. Selbst wenn die Ziele und Elemente der Zielseite noch nicht festgelegt sind, werden wir gemeinsam den Umfang des Sammelns rückwärts planen.


Empfohlene Artikel

  • Die Lebensmittel- und Arzneimittelbehörde überwacht monatlich 310.000 Beiträge - Veränderungen im Online-Überwachungssystem
  • Warum gibt das Daten-Team eines Großunternehmens das direkte Crawlen auf?
  • Warum variieren die Angebote für das Crawlen je nach Unternehmen - Kostenstruktur und versteckte Kosten

Beginnen Sie jetzt

Sammeln Sie nur Daten oder stehen Sie noch am Anfang? Unabhängig vom Standpunkt helfen wir Ihnen dabei, die Pipeline zu gestalten, damit die Daten für Entscheidungen genutzt werden können.

Kontaktieren Sie uns für eine Datenberatung

Comments

Add Comment

Your email won't be published and will only be used for reply notifications.

Weiterlesen

Get notified of new posts

We'll email you when 해시스크래퍼 기술 블로그 publishes new content.

Your email will only be used for new post notifications.