Crear un rastreador con inteligencia artificial: ¿hasta dónde se puede llegar y dónde se encuentra el obstáculo?

La pregunta más común que hacen las personas que consideran la recopilación de datos en estos días. Es una pregunta válida. Si le pides a ChatGPT o a Claude que "escriban un código en Python para recopilar nombres de productos y precios de este sitio", en pocos minutos obtendrás un rastreador bastante convincente. Hace unos años, habrías necesitado un desarrollador.

97
Crear un rastreador con inteligencia artificial: ¿hasta dónde se puede llegar y dónde se encuentra el obstáculo?

"¿No deberíamos pedírselo a ChatGPT?"

Esta es la pregunta que más hacen últimamente quienes consideran la recopilación de datos. Es una pregunta válida. Si le pides a ChatGPT o a Claude que "escriban un código en Python para recopilar nombres de productos y precios de este sitio", en pocos minutos obtendrás un código razonablemente bueno. Hace unos años, esto requeriría la contratación de un desarrollador.

Por lo tanto, este artículo no dice "No se puede hacer con IA". Hay claramente un alcance en lo que se puede hacer, y si está dentro de ese alcance, es mejor hacerlo uno mismo. Sin embargo, al operarlo, se encontrarán puntos de bloqueo definidos, por lo que conocer hasta dónde se puede llegar con la IA y dónde comienzan los problemas diferentes puede reducir en gran medida los errores.


Comencemos reconociendo lo que se puede hacer

Para sitios con una estructura simple, recopilar una pequeña cantidad de datos una vez, un rastreador creado por IA es suficiente. Puedes corregirlo conversando con la IA sin necesidad de saber código, y prácticamente no tiene costo. De hecho, en nuestro blog también hay un artículo que explica cómo crear un bot de rastreo con ChatGPT.

Estas son las cosas que la IA hace bien:

  • Escribir el código del rastreador en sí mismo: encontrar selectores, lógica de análisis, guardar en Excel
  • Ofrecer una solución de modificación de código cuando se le proporciona un mensaje de error
  • Código para organizar y procesar los datos recopilados

Hasta aquí, la era de la IA ha hecho que estas tareas sean mucho más fáciles. El problema es que el código no es todo en el rastreo.


Cinco puntos de bloqueo

1. Los bloqueos son problemas de infraestructura, no de código

La mayoría de los códigos generados por IA utilizan métodos de solicitud básicos. Funcionan en sitios pequeños, pero se bloquean rápidamente en sitios grandes como comercios electrónicos, portales y redes sociales que tienen una fuerte detección de bots. La IP se bloquea, aparecen CAPTCHAs y se obtiene una pantalla en blanco.

Superar esto no se trata de tener un código mejor, sino de infraestructura: IPs dinámicas (proxies residenciales), gestión de huellas del navegador, respuesta a CAPTCHAs; todas estas soluciones no se resuelven con la generación de código, sino que requieren dinero y operación. Incluso si le pides a la IA que "evite los bloqueos", sin infraestructura no se puede ejecutar.

2. Fallas silenciosas: la IA no puede detectar lo que está roto

La estructura de la página del sitio cambia sin previo aviso, y en ese momento, el rastreador se detiene o comienza a recopilar valores vacíos. Si le pides a la IA que lo arregle, lo hará, pero no te informará primero de que algo está roto.

Este es el punto más crítico en la operación. Descubrir después de dos semanas que la recopilación ha estado vacía y descubrirlo por primera vez durante el análisis mensual es una situación complicada: los datos del período pasado no se recuperarán. Para la recopilación automática, se necesita un sistema de monitoreo que incluya supervisión de la cantidad recopilada, detección de anomalías y notificaciones, pero esto es un sistema externo al código del rastreador.

3. En estructuras complejas, al final, las personas hacen la depuración

En estructuras como páginas dinámicas donde se carga contenido al desplazarse, sesiones de inicio de sesión, marcos anidados, la tasa de éxito del código generado por la IA disminuye drásticamente. En estructuras donde el código oscila entre "funciona" y "no funciona", llegar a un punto en el que se necesita alguien que sepa leer código es inevitable si comenzaste sin saber programar.

4. La recopilación regular y a gran escala es un sistema, no un script

Para recopilar de manera estable decenas de miles de datos diariamente, se necesitan dispositivos como programación de tareas, reintento en caso de falla, eliminación de duplicados, verificación de formato de valores. Un script que se ejecuta una vez y un sistema de recopilación diaria son cosas diferentes. Si bien la IA puede escribir el código de estos componentes, ensamblarlos y operarlos sigue siendo trabajo humano.

5. La toma de decisiones legales y la responsabilidad no recaen en la IA

Si los datos recopilados son de dominio público, si no hay problemas de privacidad o derechos de autor, si no hay problemas con los términos de servicio y la carga del servidor, la IA puede ofrecer opiniones de referencia, pero la toma de decisiones y la responsabilidad son responsabilidad del usuario. Especialmente si planeas utilizar los datos recopilados para un negocio, este aspecto debe abordarse antes de comenzar.


Cambiando de perspectiva: la IA ha reducido los costos de desarrollo y, por lo tanto, el valor se ha trasladado a la operación

La conclusión que atraviesa estos cinco puntos es una: la IA ha reducido el costo de desarrollo del rastreador, y el costo real del rastreo se encuentra cada vez más en la operación. La infraestructura para enfrentar bloqueos, la detección y reparación de fallas, la gestión de la calidad de los datos: aunque esto ya era difícil antes, la brecha se ha vuelto más evidente ahora que el desarrollo es más fácil.

Por eso, también utilizamos IA. Si un rastreador se detiene debido a un cambio en el sitio, la IA analiza primero la causa, propone una solución, y luego el personal la revisa antes de implementarla. Gracias a la IA, la reparación es más rápida, pero lo que hace que la IA funcione es el sistema de monitoreo, la infraestructura y el proceso de revisión. La diferencia entre la IA autónoma y la IA dentro de un sistema operativo radica aquí.


Entonces, ¿cuándo hacerlo directamente con IA y cuándo delegar?

Situación Recomendación
Sitio simple, poca cantidad, única vez Directamente con IA: es suficiente y más económico
Si hay alguien que pueda manejar código y el objetivo no es exigente Asistencia de IA + Operación directa también es viable
Sitios con bloqueos fuertes (grandes comercios electrónicos, redes sociales, etc.) La infraestructura es clave: área de servicios de recopilación
Recopilación diaria o semanal, datos vinculados al trabajo Monitoreo y mantenimiento son clave: área de servicios de recopilación

En resumen: código para una vez, IA; recopilación continua, sistema operativo es lo más razonable.


Preguntas frecuentes

P. ¿Si la IA avanza más, no se encargará automáticamente de la operación del rastreador?
La velocidad de reparación seguirá mejorando. Nosotros también estamos utilizando la IA en esa dirección. Sin embargo, la infraestructura para enfrentar bloqueos (proxies, etc.) y el "sistema de detección de fallas" son problemas de un eje diferente al de la generación de código, por lo que a medida que la IA mejora, la importancia de esta base operativa aumenta.

P. ¿Si me atasco mientras hago algo con IA, puedo delegarlo en ese momento?
Sí, puedes hacerlo. De hecho, muchas personas lo hacen, y aquellos que lo han intentado directamente suelen tener requisitos claros, lo que acelera el proceso. Compartir el código que has intentado o los puntos de bloqueo puede ser útil para la revisión.

P. ¿Qué diferencia hay si delego después de hacerlo con IA?
En términos de desarrollo del rastreador, la diferencia se está reduciendo. La diferencia radica en la operación: la infraestructura para enfrentar bloqueos, la supervisión y notificación automáticas, la reparación gratuita ante cambios en el sitio y la verificación de la calidad de los datos se incluyen en el servicio.


Artículos recomendados para leer juntos

  • Crear un bot de rastreo en Coupang con ChatGPT: Extracción de información de productos en los resultados de búsqueda
  • ¿Por qué los equipos de datos de las grandes empresas renuncian a la recopilación directa?
  • ¿Cómo empezar con la extracción de datos web? Comparación de 4 métodos, desde copiar manualmente hasta servicios de recopilación
  • Comparación del costo total (TCO) de la suscripción a servicios de rastreo frente al pago individual: Si no lo comparas, perderás dinero

Comienza ahora mismo

¿Te has atascado al intentarlo con IA? Si nos dices el sitio objetivo y dónde te has atascado, te diagnosticaremos de forma gratuita si la recopilación es posible y cuál es el enfoque adecuado.

Consulta de recopilación

Comments

Add Comment

Your email won't be published and will only be used for reply notifications.

Sigue leyendo

Get notified of new posts

We'll email you when 해시스크래퍼 기술 블로그 publishes new content.

Your email will only be used for new post notifications.