Wie fange ich mit dem Extrahieren von Webdaten an? - Vergleich von vier Methoden, von manuellem Kopieren bis zum Sammeldienst

Konkurrenzpreise, Produktbewertungen, Unternehmenslisten, Nachrichtenartikel - Alle benötigten Informationen sind auf dem Bildschirm sichtbar, aber es ist überwältigend, sie in Excel zu analysieren. Es ist einfach, wenn es sich um ein oder zwei Seiten handelt, aber bei Hunderten von Seiten ist es eine andere Geschichte.

92
Wie fange ich mit dem Extrahieren von Webdaten an? - Vergleich von vier Methoden, von manuellem Kopieren bis zum Sammeldienst

Wenn Sie alles auf dem Bildschirm sehen, aber sich beim Verschieben in Excel überwältigt fühlen

Konkurrenzpreise, Produktbewertungen, Unternehmenslisten, Nachrichtenartikel - Alle benötigten Informationen sind auf dem Web-Bildschirm sichtbar, aber wenn Sie sie wirklich analysieren und in Excel verschieben möchten, kann es überwältigend sein. Wenn es sich um ein oder zwei Seiten handelt, reicht es aus, sie zu kopieren. Wenn es sich jedoch um Hunderte von Seiten handelt, ist dies eine andere Geschichte.

Das Übertragen von auf einer Website veröffentlichten Informationen in tabellarische Daten wird als Webdatenextraktion (Web-Scraping, Web-Crawling) bezeichnet. Dieser Artikel vergleicht und fasst vier verschiedene Methoden für Anfänger in der Datenextraktion zusammen. Es wurde so geschrieben, dass es auch von Personen ohne Programmierkenntnisse gelesen werden kann.


Methode 1. Manuelle Kopie - Schnellster Start, schnellste Grenze

Dies ist buchstäblich eine Methode, bei der der Inhalt des Bildschirms kopiert und in Excel eingefügt wird. Es ist die richtige Wahl, wenn es sich um eine Aufgabe handelt, die nur einmal für ein oder zwei Seiten durchgeführt werden muss, da weder Werkzeuge noch Kosten erforderlich sind.

Die Grenzen sind offensichtlich. Selbst bei einer geringfügigen Zunahme der Menge wird die Zeit unerträglich, und da Menschen die Aufgabe ausführen, können Fehler auftreten, indem Informationen ausgelassen oder falsch übertragen werden. Vor allem wird es unmöglich, Aufgaben wie "wöchentliche Überprüfung" durchzuführen, die regelmäßige Bestätigungen erfordern.


Methode 2. Extraktionswerkzeug - Auch für einfache Websites ohne Programmierkenntnisse

Dies ist eine Methode, bei der Browsererweiterungen oder No-Code-Datenextraktionstools verwendet werden. Indem Sie die gewünschten Elemente auf dem Bildschirm durch Klicken auswählen, wird eine Tabelle erstellt, sodass Sie ohne Programmierung Hunderte von Datensätzen sammeln können.

Es gibt jedoch Grenzen, die diese Tools bewältigen können.

  • Dynamische Seiten, auf denen bei jedem Scrollen neue Inhalte angezeigt werden, oder Seiten, die eine Anmeldung erfordern, sind häufig problematisch.
  • Große Websites haben Vorkehrungen getroffen, um den automatischen Zugriff zu blockieren. Daher können Tools schnell blockiert werden.
  • Wenn sich das Layout der Website ändert, müssen die Einstellungen von Grund auf neu vorgenommen werden.

Für gelegentliche Sammlungen von strukturierten einfachen Websites ist dies nützlich, aber für mehr gibt es die folgenden beiden Methoden.


Methode 3. Eigene Entwicklung - Höchste Flexibilität, aber auch Wartungsaufwand

Dies ist eine Methode, bei der Entwickler Crawler mit Python oder ähnlichen Sprachen direkt erstellen. Die Flexibilität ist hier am größten, da Sie unabhängig von der Website oder dem Element die gewünschte Form erhalten können.

Es wird jedoch eine Person benötigt, die dies erstellen kann, und die eigentliche Arbeit beginnt erst nach der Erstellung. Sie müssen den Crawler jedes Mal anpassen, wenn sich die Website ändert, und bei Websites mit starken Blockaden müssen Sie eine separate Infrastruktur (Proxy usw.) betreiben, um diese zu umgehen. Es ist auch Aufgabe, zu überwachen, ob die Sammlung gestoppt wurde. Tatsächlich geben selbst große Unternehmen aufgrund der Belastung durch diese Wartungsaufgaben häufig die direkte Sammlung auf.

Wenn es schwierig ist, Entwicklungsressourcen für zusätzliche Zwecke zu binden, ist es ratsam, vor Beginn die Betriebskosten zu berücksichtigen.


Methode 4. Datenbeschaffungsservice - Anforderungen übermitteln und nur Daten erhalten

Dies ist eine Methode, bei der die Datenerfassung an ein spezialisiertes Unternehmen ausgelagert wird. Wenn Sie angeben, welche Elemente Sie von welcher Website in welchem Intervall erhalten möchten, übernimmt das Unternehmen alles von der Entwicklung des Crawlers über die Blockierungsbewältigung, die Wartung bei Änderungen der Website bis hin zur Überwachung der Sammlung, und Sie erhalten nur die Ergebnisdaten.

  • Keine Programmierkenntnisse erforderlich - Anforderungen können in Alltagssprache übermittelt werden
  • Besonders geeignet für Websites mit starken Blockaden, wiederholte Sammlungen und große Mengen
  • Sie können wählen, wie Sie die Daten erhalten möchten, z. B. in Excel, per E-Mail, über eine API oder eine Datenbankverbindung

Natürlich entstehen Kosten. Daher sind die vorherigen Methoden besser für geringe Mengen und einmalige Vorgänge geeignet, während der Service vorteilhafter wird, wenn Sie kontinuierlich und in großen Mengen Daten erhalten müssen.


Vergleich auf einen Blick

Kategorie Manuelle Kopie Extraktionswerkzeug Eigene Entwicklung Datenbeschaffungsservice
Programmierkenntnisse Nicht erforderlich Nicht erforderlich Erforderlich Nicht erforderlich
Bewältigbare Menge Dutzende Hunderte Unbegrenzt Unbegrenzt
Wiederholte (regelmäßige) Sammlung Praktisch unmöglich Begrenzt Möglich Möglich
Websites mit starken Blockaden Schwierig Aufbau einer Infrastruktur erforderlich Möglich
Anpassung an Änderungen auf der Website Neu konfigurieren erforderlich Direkte Reparatur Vom Unternehmen übernommen
Kosten Zeit Toolgebühren Personalkosten + Infrastruktur Servicegebühren

Kriterien für die Auswahl des Startpunkts

In der Regel erhalten Sie eine Antwort, wenn Sie sich auf drei Dinge konzentrieren.

  • Menge - Manuell für Dutzende, Werkzeug für Hunderte, Entwicklung oder Service für mehr
  • Häufigkeit - Einmalig für leichte Methoden, automatisiert (Entwicklung/Service) für wöchentliche/tägliche Wiederholungen
  • Schwierigkeitsgrad der Zielseite - Bei großen E-Commerce- oder SNS-Websites mit starken Blockaden sind Tools schwierig und die Entwicklung erfordert eine große Infrastruktur, daher liegt der Servicebereich nahe

Zusammengefasst: Wenn es sich um eine einmalige leichte Aufgabe handelt, versuchen Sie es manuell oder mit einem Tool, und wenn es sich um kontinuierliche Daten handelt, entscheiden Sie anhand der Verfügbarkeit von Betriebsressourcen zwischen Entwicklung und Datenerfassungsservice.


Dinge, die Sie vor dem Start wissen sollten: Nicht alle Daten sind verfügbar

  • Nicht angezeigte Informationen können nicht extrahiert werden. Die Webdatenextraktion bezieht sich auf das Übertragen von Informationen auf dem öffentlichen Bildschirm und nicht auf das Abrufen von nicht öffentlichen Daten.
  • Es gibt Bereiche, die rechtliche Überprüfungen erfordern. Die Verwendung öffentlicher Daten für interne Analysen unterscheidet sich von der Erfassung personenbezogener Daten oder der unveränderten Weitergabe von Inhalten. Da die Bewertung je nach Zweck und Verwendung variieren kann, ist es sicherer, dies vor der Erfassung zu überprüfen, wenn es unklar ist.

Häufig gestellte Fragen

F. Kann ich mit keinerlei Programmierkenntnissen mit der Datenextraktion beginnen?
Ja. Bei geringen Mengen können Sie es mit einem Extraktionswerkzeug selbst versuchen, und bei größeren Projekten können Sie die Anforderungen an den Datenerfassungsservice in Alltagssprache übermitteln. Es reicht aus, wenn die Anforderungen wie "Welche Informationen von welcher Website in welchem Intervall" klar definiert sind.

F. Wie hoch sind die Kosten für den Datenerfassungsservice?
Die Kosten variieren je nach Schwierigkeitsgrad der Zielseite und der Menge/Intervall der Datenerfassung. Durch das Einholen von Kostenvoranschlägen können Sie die Kostenstruktur (Entwicklungs-, Betriebs- und Wartungskosten) überprüfen. Eine Anleitung zum Vergleich finden Sie in der Kostenschätzungshilfe in dem Artikel "Gemeinsam betrachtet".

F. Können alle Websites vollständig erfasst werden?
Die meisten öffentlich angezeigten Informationen können erfasst werden, aber der Schwierigkeitsgrad variiert je nach Website. Bei Websites mit starken Blockaden ist eine separate Infrastruktur erforderlich. Daher ist es ratsam, zuerst zu prüfen, ob die Erfassung möglich ist, bevor Sie beginnen.


Empfohlene Artikel

  • Warum geben Datenabteilungen großer Unternehmen das Crawlen auf?
  • Einführung in das Outsourcing von Crawling - Von der Anfrage bis zum ersten Datensatz, Schritt für Schritt erklärt
  • Wie wählt man ein Crawling-Unternehmen aus? - 7 Punkte, die vor der Auslagerung der Datenerfassung überprüft werden sollten
  • Warum variieren die Crawling-Kostenvoranschläge je nach Unternehmen? - Kostenstruktur und versteckte Kosten

Jetzt sofort starten

Wenn Sie unsicher sind, welche Methode die richtige ist, teilen Sie uns die Website und die Elemente mit, die Sie sammeln möchten. Wir bieten Ihnen eine kostenlose Diagnose zur Erfassbarkeit und zur geeigneten Methode an.

Kontaktieren Sie uns für Crawling

Comments

Add Comment

Your email won't be published and will only be used for reply notifications.

Weiterlesen

Get notified of new posts

We'll email you when 해시스크래퍼 기술 블로그 publishes new content.

Your email will only be used for new post notifications.