"Kann ich ChatGPT fragen?"
Diejenige Frage, die heutzutage von denjenigen, die Daten sammeln möchten, am häufigsten gestellt wird. Es ist eine berechtigte Frage. Wenn Sie ChatGPT oder Claude bitten, "Schreiben Sie mir bitte Python-Code, um Produktinformationen und Preise von dieser Website zu sammeln", erhalten Sie innerhalb weniger Minuten einen ziemlich überzeugenden Crawler-Code. Vor ein paar Jahren mussten Sie dafür einen Entwickler engagieren.
Deshalb bedeutet dieser Artikel nicht, dass "es mit KI nicht funktioniert". Es gibt definitiv einen Bereich, in dem es funktioniert, und in diesem Bereich ist es am besten, es selbst zu tun. Wenn Sie jedoch tatsächlich betreiben, stoßen Sie auf bestimmte Engpässe, wo KI funktioniert und wo andere Probleme beginnen, und wenn Sie dies im Voraus wissen, können Sie Fehler erheblich reduzieren.
Lassen Sie uns mit dem Möglichen beginnen
Für einfache Websites, die eine geringe Menge Daten einmalig sammeln, reicht ein von KI erstellter Crawler aus. Sie können mit KI interagieren, um den Code zu verbessern, auch wenn Sie den Code nicht kennen, und es entstehen praktisch keine Kosten. Tatsächlich haben wir in unserem Blog einen Artikel darüber, wie man mit ChatGPT einen Crawling-Bot erstellt.
Hier ist, was KI gut kann:
- Schreiben des Crawler-Codes selbst — Finden von Selektoren, Parsen der Logik, Speichern in Excel
- Bereitstellung von Codeänderungsvorschlägen bei Fehlermeldungen
- Code zur Bereinigung und Verarbeitung der gesammelten Daten
Bis hierher ist es in der Ära der KI definitiv einfacher geworden. Das Problem ist, dass der Code beim Crawlen nur die Hälfte der Arbeit erledigt.
Fünf Punkte, an denen es hakt
1. Blockaden sind keine Codeprobleme, sondern Infrastrukturprobleme
Der von KI erstellte Code verwendet in der Regel grundlegende Anforderungsmethoden. Auf kleinen Websites funktioniert das gut, aber auf großen E-Commerce-, Portal- oder Social-Media-Websites mit starker Bot-Erkennung wird der Crawler schnell blockiert. Die IP wird gesperrt, Captchas erscheinen, und es wird eine leere Seite zurückgegeben.
Das Überwinden dieser Blockaden erfordert nicht besseren Code, sondern Infrastruktur. Dynamische IPs (Residential Proxies), Browser-Fingerprint-Management, Captcha-Handling — all dies kann nicht durch Codegenerierung gelöst werden, sondern ist ein Bereich, der Geld und Betrieb erfordert. Selbst wenn Sie KI bitten, "Helfen Sie mir, die Blockaden zu umgehen", können Sie dies ohne Infrastruktur nicht ausführen.
2. Stille Fehler — KI erkennt nicht, wenn etwas kaputt ist
Die Bildschirmstruktur einer Website ändert sich unerwartet, und in diesem Moment bleibt der Crawler stehen oder beginnt leere Werte zu sammeln. Wenn Sie KI bitten, dies zu beheben, wird sie es tun, aber sie wird Ihnen nicht zuerst mitteilen, dass etwas kaputt ist.
Der gefährlichste Punkt im Betrieb ist dieser. Wenn zwei Wochen lang keine Daten gesammelt wurden und dies erst bei der Analyse am Monatsende festgestellt wird, können die Daten aus der vergangenen Zeit nicht wiederhergestellt werden. Automatisierte Sammlung erfordert ein Überwachungs-, Anomalieerkennungs- und Benachrichtigungssystem außerhalb des Crawler-Codes, aber das ist ein System außerhalb des Crawlers.
3. In komplexen Strukturen muss ein Mensch Debugging durchführen
In Strukturen wie dynamischen Seiten, auf denen Inhalte beim Scrollen geladen werden, Sitzungen für das Einloggen, verschachtelte Frames usw., sinkt die Erfolgsrate des von KI erstellten Codes drastisch. Wenn Sie zwischen "funktioniert" und "funktioniert nicht" hin und her wechseln und dutzende Male mit KI hin und her kommunizieren, wird irgendwann jemand benötigt, der den Code lesen kann. Wenn Sie ohne Programmierkenntnisse beginnen, ist dies die praktische Barriere.
4. Regelmäßige und umfangreiche Sammlung erfordert ein System, kein Skript
Um täglich Tausende von Datensätzen stabil zu sammeln, sind Mechanismen wie Zeitplanung, erneuter Versuch bei Fehlern, Duplikatentfernung, Validierung von Wertformaten erforderlich. Ein einmaliges Skript und ein täglich laufendes Sammelsystem sind unterschiedliche Dinge. KI kann auch den Code für diese Komponenten erstellen, aber deren Zusammenstellung und Betrieb bleibt weiterhin eine menschliche Aufgabe.
5. Rechtliche Beurteilung und Verantwortung liegen nicht bei KI
Ob das Sammelziel öffentliche Daten sind, ob es Probleme mit personenbezogenen Daten oder Urheberrechten gibt, ob es keine Probleme mit den Nutzungsbedingungen und der Serverlast gibt — KI kann beratend tätig sein, aber die Beurteilung und Verantwortung liegt beim Benutzer. Insbesondere wenn Sie planen, die gesammelten Daten für Ihr Geschäft zu nutzen, sollten Sie dies vorab klären.
Ein Perspektivenwechsel: KI hat die Entwicklungskosten gesenkt, wodurch der Wert in den Betrieb übergegangen ist
Der Schluss, der sich durch die fünf Punkte zieht, ist einer. Was KI gesenkt hat, sind die Entwicklungskosten für Crawler, und die tatsächlichen Kosten für das Crawlen liegen immer mehr im Betrieb. Blockadenbewältigungsinfrastruktur, Fehlererkennung und -reparatur, Datenqualitätsmanagement — dies war früher schon schwierig, aber jetzt, da die Entwicklung einfacher geworden ist, ist der Unterschied deutlicher geworden.
Deshalb nutzen auch wir KI. Wenn der Crawler aufgrund von Änderungen auf der Website stehen bleibt, analysiert die KI zuerst die Ursache, erstellt einen Lösungsvorschlag, und ein Mensch überprüft und übernimmt dies. Dank KI werden Reparaturen schneller durchgeführt, aber das, was die KI arbeiten lässt, sind Überwachungssysteme, Infrastruktur und Überprüfungsprozesse außerhalb des Crawlers. Der Unterschied zwischen KI allein und KI im Betrieb liegt hier.
Also, wann sollte man direkt mit KI arbeiten und wann sollte man es delegieren?
| Situation | Empfehlung |
|---|---|
| Einfache Website, geringe Menge, einmalig | Direkt mit KI arbeiten — ausreichend und am kostengünstigsten |
| Es gibt Personen, die mit Code umgehen können, und das Ziel ist nicht anspruchsvoll | KI unterstützt + Selbstbetrieb ist eine Option |
| Websites mit starken Blockaden (große E-Commerce-, SNS-Websites usw.) | Die Infrastruktur ist entscheidend — Bereich des Sammeldienstes |
| Tägliche oder wöchentliche wiederholte Sammlung, Daten sind geschäftlich relevant | Überwachung und Wartung sind entscheidend — Bereich des Sammeldienstes |
Kurz gesagt: Einmal auszuführender Code sollte KI überlassen werden, während kontinuierliche Sammlungen dem Betriebssystem überlassen werden sollten.
Häufig gestellte Fragen
F: Wenn KI weiterentwickelt wird, wird sie dann nicht auch den Betrieb von Crawlern automatisieren?
Die Reparaturgeschwindigkeit wird weiter zunehmen. Wir nutzen auch KI in diese Richtung. Die Bewältigung von Blockaden (Proxies usw.) und das "Erkennen von Fehlern" sind jedoch Probleme einer anderen Kategorie als die Codegenerierung, daher wird der Anteil des Betriebs in diesem Bereich mit der Verbesserung der KI eher größer.
F: Kann ich, wenn ich bei der Erstellung mit KI stecken bleibe, es dann delegieren?
Ja. Tatsächlich gibt es viele, die so vorgehen, und je mehr Erfahrung Sie haben, desto schneller geht es voran, da die Anforderungen klarer sind. Das Teilen des Codes oder der Stellen, an denen Sie stecken geblieben sind, ist hilfreich für die Überprüfung.
F: Was ist der Unterschied, wenn ich es delegiere, verglichen mit dem, was mit KI erstellt wurde?
Wenn man nur die Crawler-Entwicklung betrachtet, wird der Unterschied tatsächlich geringer. Der Unterschied liegt im Betrieb — Blockadenbewältigungsinfrastruktur, Überwachung und automatische Benachrichtigungen, kostenlose Reparaturen bei Website-Änderungen und Datenqualitätsprüfung sind in den Service integriert.
Empfohlene Artikel
- Erstellen eines Crawler-Bots für Coupang mit ChatGPT: Extrahieren von Produktinformationen aus Suchergebnissen
- Warum geben große Unternehmen das Crawlen auf?
- Wie fängt man mit der Webdatenextraktion an — Vergleich von vier Methoden, vom manuellen Kopieren bis zum Sammeldienst
- Vergleich von Crawling-Abonnement und Einzelabrechnung — Ohne Gesamtkostenvergleich für ein Jahr machen Sie Verluste
Jetzt sofort starten
Haben Sie es mit KI versucht und sind stecken geblieben? Teilen Sie uns die Zielseite und den Punkt, an dem Sie stecken geblieben sind, mit, und wir werden kostenlos eine Diagnose durchführen, ob und wie die Sammlung möglich ist.




