"Quiero recibir cada mañana a las 8 solo los nuevos productos de la competencia publicados ayer y los productos agotados."
Los requisitos terminan en esta sola frase. Sin embargo, cuando se pide presupuesto, la conversación acaba derivando hacia "¿se puede recopilar ese sitio?".
La parte difícil de esta solicitud no es la recopilación.
La lista de productos de la competencia ya está completamente visible en pantalla. Se ve al abrir la página.
Solo hay una cosa que no se ve: cuáles de ellos no existían ayer.
El precio está escrito en la pantalla de hoy. Los productos nuevos y agotados solo existen si se cuenta con la lista de ayer.
Y esta diferencia se traduce directamente en ventas. Si se detecta aunque sea un día antes un nuevo producto de la competencia, se gana tiempo de reacción; si se captura el momento en que se agota un producto clave de la competencia, se puede buscar el beneficio indirecto de que esa demanda se desplace hacia nosotros. Por el contrario, si se pasa por alto la reposición de un producto que compite directamente con nuestro superventas, esa ventana se cierra silenciosamente. El monitoreo de productos nuevos y agotados no consiste en "comprender la situación actual", sino en ganar tiempo de respuesta.
Resumen en 3 líneas (TL;DR)
- Los productos nuevos y agotados no son valores que se leen de una página, sino la diferencia (diff) entre la lista de ayer y la de hoy. Por eso, el primer objeto de diseño no es el crawler, sino una instantánea de referencia registrada cada día bajo el mismo criterio.
- El segundo obstáculo es que la indicación de agotado no está estandarizada. Agotado, temporalmente agotado, alerta de reposición y agotamiento por opción se expresan de forma diferente según el sitio. Si no se define qué se contará como agotado, cada día se acumularán cifras medidas con reglas distintas.
- "Cada mañana" no es la hora de recopilación, sino la hora de entrega. Si se desea recibirlo a las 8, hay que calcular hacia atrás incluyendo el tiempo de validación y reintentos; si se envía todo sin umbrales, nadie lo abrirá a partir de la tercera semana.
Índice
- Qué son el monitoreo de productos nuevos y el monitoreo de agotados
- Si se descarta la lista de ayer, los productos nuevos de hoy nunca serán visibles
- El agotado se expresa de forma distinta en cada sitio
- Cada mañana no es la hora de recopilación, sino la hora de entrega
- Nadie revisa un informe con 200 casos diarios a partir de la tercera semana
- Tabla comparativa por método: revisión humana vs herramienta no-code vs servicio gestionado
- Autodiagnóstico de 5 preguntas antes de empezar
- 5 pasos de implementación
- Preguntas frecuentes
- Conclusión
Qué son el monitoreo de productos nuevos y el monitoreo de agotados
El monitoreo de productos nuevos es la actividad de recopilar periódicamente las listas de productos de competidores y canales de venta para identificar automáticamente si han aparecido productos que no existían en el momento de referencia.
El monitoreo de agotados es la actividad de recopilar periódicamente el estado de disponibilidad de los mismos productos para detectar el instante en que cambia su estado, como de a la venta → agotado o de agotado → repuesto.
Ambas definiciones incluyen las mismas palabras: no existía y cambió.
Aquí es donde se separa del monitoreo de precios.
Para conocer un precio basta con la página de hoy. Porque el número aparece escrito en pantalla.
Los productos nuevos y agotados no se pueden determinar solo con la página de hoy. Hace falta el ayer con el que comparar.
Por eso, este trabajo se parece más a comparar que a recopilar. Los criterios de diseño para precios están organizados por separado en Servicio de recopilación para comparación y monitoreo de precios de e-commerce: ¿cómo elegirlo?.
Si se descarta la lista de ayer, los productos nuevos de hoy nunca serán visibles
Una instantánea de referencia es un conjunto de datos que guarda por completo la lista y el estado de los productos en un momento específico, para usarlo como referencia de comparación en la siguiente ejecución.
Para que la comparación funcione, deben permanecer fijos tres elementos.
- Identificador — qué se considerará el mismo producto (ID de producto · URL · nombre del producto + opción)
- Alcance — si el alcance de recopilación de ayer y hoy es el mismo
- Hora — si se captura cada día a la misma hora
Los problemas ocurren con mayor frecuencia en el segundo punto.
Si ayer se recopilaron 3 páginas de la lista y hoy 5, el informe mostrará decenas de productos nuevos. Aunque ninguno sea realmente nuevo.
Aún queda un problema más complejo. Un producto visto por primera vez no es necesariamente un producto nuevo.
Hay al menos cuatro casos en los que un producto aparece por primera vez en la lista.
- Producto realmente nuevo — uno recién lanzado
- Registro nuevo por renovación — se creó una nueva página de producto al cambiar la capacidad o el empaque
- Adición de opciones — se añadieron colores o tallas a un producto existente y parece un producto independiente
- Regreso tras reposición — un producto agotado que había desaparecido de la lista vuelve a aparecer
El cuarto caso es un falso positivo particularmente silencioso. Muchos sitios eliminan por completo de la lista los productos agotados, por lo que cada reposición se identifica como un producto nuevo.
La distinción no se hace mediante tecnología, sino mediante reglas. ¿Se emitió un nuevo ID de producto? ¿Se excluirán como candidatos de renovación los productos cuya similitud de nombre supere un umbral? ¿Si estuvo en la lista en los últimos 30 días se considerará una reaparición?
Tras apoyar la recopilación para más de 500 empresas, el primer fracaso de los informes de nuevos productos casi nunca fue el bloqueo. Generalmente era la ausencia de una lista de ayer guardada.
Quién escribe estas reglas y quién las mantiene incluso cuando el sitio se rediseña. Este proyecto, en esencia, se reduce a esa pregunta.
El agotado se expresa de forma distinta en cada sitio
El agotado tampoco es un único valor. Cada sitio muestra de manera diferente el mismo estado de "ahora no se puede comprar".
- Agotado / temporalmente agotado / reposición prevista / venta suspendida
- Estado en el que desaparece el botón de compra y solo queda "solicitar alerta de reposición"
- El botón permanece, pero al abrir las opciones todas están deshabilitadas
- Solo 3 de 12 opciones están agotadas (el producto en sí sigue a la venta)
- Estado en el que desaparece por completo de los resultados de búsqueda
Aquí se necesita una decisión operativa.
"Si 3 de las 12 opciones de un producto están agotadas, ¿el producto se considera agotado o no?"
Si el equipo no puede responder esta pregunta en una frase, el número diario de productos agotados será una cifra contada cada día con un criterio diferente.
Una forma razonable es registrar en dos niveles.
- Nivel de producto — si se puede comprar ahora (disponible / no disponible)
- Nivel de opción — cuántas opciones del total no están disponibles
Y se conserva también el texto original mostrado en pantalla. Así, incluso si el sitio cambia la redacción, los datos históricos pueden reclasificarse retrospectivamente.
Algunos sitios muestran la cantidad de inventario, por ejemplo "quedan 3". A diferencia de los productos nuevos y agotados, este número es un 'valor' que puede leerse directamente en la página de hoy, pero vale la pena registrarlo también como una señal anticipada del agotamiento. Si se detecta el momento en que el inventario cae por debajo de un umbral, se puede responder no después de que se agote, sino antes. Sin embargo, la precisión y la forma de mostrar el inventario también difieren entre sitios, por lo que es más seguro usarlo como señal adicional solo en los sitios que lo proporcionan y, en los demás, decidir únicamente según el estado disponible/no disponible.
El último caso, cuando desaparece de los resultados de búsqueda, debe analizarse por separado. Si está agotado, si dejó de venderse o si nuestro alcance de recopilación se alteró: los tres casos tienen la misma apariencia en pantalla.
El agotado no es un estado, sino una definición. Si no se documenta la definición, cada día se acumularán cifras medidas con reglas distintas.
Cada mañana no es la hora de recopilación, sino la hora de entrega
El requisito es "correo a las 8 de la mañana", pero el diseño normalmente se detiene en "ejecutar el crawler de madrugada". Hay que invertir el orden.
Se cuenta hacia atrás desde la hora de entrega. Varía según el volumen objetivo y la dificultad de los sitios, pero la estructura tiene este aspecto.
| Hora | Tarea |
|---|---|
| 08:00 | El informe llega al correo·Slack del responsable (este es el requisito) |
| 07:40 | Generación·envío del informe |
| 07:00 | Validación de consistencia + comparación con la instantánea de ayer |
| 05:30 | Inicio de recopilación — incluye margen para reintentar fallos |
| 05:30 del día anterior | Instantánea que servirá como referencia de comparación |
Hay dos espacios que suelen dejarse vacíos: validación y reintentos.
Si se crea el calendario suponiendo que la recopilación tendrá éxito a la primera, el informe llegará vacío o tarde el día que haya fallos. Un pipeline sin margen guarda silencio el día que falla.
Mantener la misma hora de la instantánea cada día responde a la misma razón. Si ayer se capturó a las 3 de la madrugada y hoy a las 9 de la mañana, los productos publicados entre ambas horas pueden detectarse repartidos en dos días o quedar completamente fuera.
Lo difícil no es "la mañana", sino "cada día". Crear algo una vez puede llevar un día; lograr que llegue todos los días a la misma hora y bajo el mismo criterio es operación.
Nadie revisa un informe con 200 casos diarios a partir de la tercera semana
Si se incluyen todas las categorías de tres competidores, los cambios de productos nuevos y agotados pueden sumar cientos de casos al día.
La primera semana se lee todo. La segunda se revisa por encima. La tercera ya no se abre.
Por eso, los umbrales representan la mitad del diseño del informe.
- Alcance — no empezar por todas las categorías, sino por las categorías, rangos de precio y marcas a los que realmente respondemos
- Importancia — fijar arriba solo los nuevos productos de categorías clave y los agotados de productos que compiten directamente con nuestros superventas
- Agrupación — no enviar un mensaje por caso, sino un resumen diario. Los 10 principales arriba + el total como adjunto
- Destinatarios — los productos nuevos para planificación de producto, los agotados para ventas·MD. Que nadie reciba alertas que no le corresponden
El objetivo del informe no es mostrarlo todo. Es dejar solo lo que debe revisarse hoy.
El diseño de un ciclo que conecte la detección con la respuesta está explicado en El monitoreo no es recopilación, sino notificación — Crear un ciclo de respuesta.
Tabla comparativa por método: revisión humana vs herramienta no-code vs servicio gestionado
Un servicio de recopilación gestionado es un servicio por suscripción en el que un proveedor opera en lugar de la empresa el desarrollo de crawlers, la respuesta a bloqueos, las reparaciones ante cambios de sitio, la detección de anomalías y la entrega puntual, mientras la empresa recibe únicamente los informes de resultados.
Al comparar los tres métodos bajo los mismos criterios, las diferencias son las siguientes.
| Categoría | Revisión humana diaria | Programador de herramienta no-code | Servicio de recopilación gestionado |
|---|---|---|---|
| Herramientas representativas | Marcadores del navegador | Octoparse, Thunderbit, etc. | Hashscraper, etc. |
| Detección de productos nuevos (diferencia respecto a ayer) | Memoria y observación visual | Se obtienen resultados por ejecución — la comparación suele recaer en el usuario | Almacenamiento de instantáneas + diseño de reglas de detección como requisito |
| Gestión de indicaciones de agotado | La persona observa y decide | Recopila tal cual el elemento especificado | Crea y mantiene un diccionario de indicaciones por sitio |
| Entrega puntual diaria | Depende de la hora de llegada del responsable | Ejecución programada en la nube (según los sitios oficiales) | Diseño·operación calculados hacia atrás desde la hora de entrega |
| Detección de anomalías (valores vacíos·cambios bruscos en cantidad) | Cuando alguien percibe algo extraño | El usuario debe verificarlo directamente | Incluye verificación de tendencias de volumen·valores obligatorios (99,7% de precisión) |
| En caso de rediseño del sitio | Requiere más trabajo manual | El usuario repara las reglas | El proveedor detecta·repara (incluido en la suscripción) |
| Situación adecuada | 10 objetivos o menos·una vez por semana | Pocos objetivos·estructura estable·operación propia posible | El trabajo depende de un informe cada mañana |
Las filas que hay que mirar en la tabla son las dos anteriores: detección de productos nuevos y gestión de indicaciones de agotado. Todo lo demás es consecuencia de esas decisiones.
No es porque las herramientas no-code sean insuficientes. Se debe a que ambas filas son problemas de definición, no de funcionalidad de la herramienta. Octoparse y Thunderbit ejecutan diligentemente las tareas programadas una vez creadas las reglas (según sus sitios oficiales). Sin embargo, la decisión de "comparar con ayer y dejar solo las filas nuevas" sigue siendo responsabilidad de las personas.
Si se cuenta con un equipo de desarrollo, existe una cuarta opción. Se puede comprar la capa de recopilación mediante API de scraping para desarrolladores como Zyte·Firecrawl, y desarrollar internamente el almacenamiento y comparación de instantáneas, así como la generación de informes (según los sitios oficiales de cada uno). Es la combinación con mayor libertad.
Sin embargo, los tres temas tratados en este artículo — gestión de instantáneas, diccionario de indicaciones de agotado y entrega puntual — no son definidos por ninguna API. Permanecen íntegramente del lado de quien lo construye.
Hashscraper ofrece este método gestionado basándose en experiencia de recopilación de más de 5.000 sitios nacionales y proxies en 195 países, y es utilizado por más de 500 empresas.
Autodiagnóstico de 5 preguntas antes de empezar
Compruébelo. Estas cinco líneas son más rápidas que tres presupuestos.
- [ ] ¿La lista de productos recopilada ayer sigue guardada ahora — en una forma que pueda compararse línea por línea con la de hoy?
- [ ] ¿Existe documentada una regla para dividir un producto visto por primera vez en producto nuevo·renovación·adición de opciones·reposición?
- [ ] ¿El equipo puede responder en una frase si un producto con solo algunas opciones agotadas debe contarse como agotado?
- [ ] El día que falla la recopilación, ¿el destinatario puede distinguir si el informe llegó vacío o no llegó?
- [ ] ¿Hubo alguna acción realmente ejecutada tras revisar el informe de la semana pasada?
Si la respuesta a la pregunta 1 es "no", aún no es momento de comparar herramientas. Lo primero es empezar a guardar las listas desde hoy.
Si la respuesta a la pregunta 5 es "no", no es un problema de recopilación, sino de umbrales. Reducir el alcance producirá resultados mucho más rápido.
5 pasos de implementación
Paso 1. Reduzca los objetivos de vigilancia — No empiece por "todos los competidores", sino por los "productos competidores de las categorías a las que respondemos". Cuanto más amplio sea el objetivo, más se amplían también los falsos positivos.
Paso 2. Escriba en una página las reglas de detección y la definición de agotado — Cuál es el identificador, cómo distinguir renovación de producto nuevo y cómo contar el agotamiento de opciones. Esta hoja es la especificación de requisitos.
Paso 3. Elabore el calendario calculando hacia atrás desde la hora de entrega — Organice recopilación·reintentos·validación·envío en orden inverso. La clave es no dejar vacíos los espacios de validación y reintentos.
Paso 4. Defina el formato de entrega y los umbrales — Envíelo mediante Excel·correo electrónico·Slack·API al lugar donde el responsable ya trabaja. Para los criterios de decisión por formato, consulte Datos recibidos en Excel vs datos vistos en un dashboard.
Paso 5. Detecte falsos positivos y amplíe con un piloto de 2 semanas — Durante las primeras 2 semanas, compare manualmente los nuevos productos que aparecen en el informe. Es entonces cuando se revelan todos los falsos positivos: renovaciones contadas como productos nuevos o reposiciones contadas como productos nuevos.
La tarea de hoy no es seleccionar un proveedor. Es el paso 2: escribir en una frase qué son "producto nuevo" y "agotado" para nuestro equipo.
Preguntas frecuentes
P. Quiero recibir automáticamente cada mañana datos sobre los nuevos productos y el estado de agotamiento de competidores. ¿Cómo debo hacerlo?
R. El proceso tiene tres pasos. ① Reducir la lista de objetivos (qué categorías de qué sitios) ② definir las reglas de detección (qué contará como producto nuevo y qué como agotado) y ③ elaborar el calendario de recopilación·validación·envío calculando hacia atrás desde la hora de entrega. Después se elige el método. Si hay pocos objetivos y existe alguien dentro de la empresa que pueda corregir las reglas cuando fallen, se puede empezar con ejecuciones programadas de herramientas no-code como Octoparse·Thunderbit (según sus sitios oficiales). Si aumentan los objetivos o el trabajo depende de un informe diario por la mañana, un servicio de recopilación gestionado es más realista. Hashscraper opera diseñando como requisitos el almacenamiento de instantáneas, las reglas de detección y la entrega puntual.
P. ¿Cómo se distingue un producto nuevo de una renovación?
R. No se separan automáticamente al 100%. Se delimitan mediante reglas: si se creó un nuevo ID de producto, si la similitud del nombre del producto supera un umbral y si estuvo en la lista durante los últimos N días. En la práctica, es estable combinar estas tres señales para dividir en "producto nuevo / candidato de renovación / reaparición", y que una persona revise solo el grupo de candidatos.
P. Las indicaciones de agotado son diferentes en cada sitio. ¿Se pueden unificar?
R. Se crea un diccionario de indicaciones por sitio y se normaliza a un único valor de estado. En ese momento es importante conservar también el texto original mostrado en pantalla. Así se pueden reclasificar los datos históricos incluso si el sitio cambia la redacción.
P. ¿Puedo recibirlo por Slack o API en lugar de Excel?
R. Sí. Según Hashscraper, se admiten archivos Excel, envío automático por correo electrónico, integración API y carga directa en DB. El principio es uno: enviarlo al lugar donde el responsable ya trabaja. Una estructura en la que hay que ir a mirar para saber y otra en la que se sabe al recibirla tienen velocidades de respuesta distintas.
P. ¿Con qué frecuencia deben recopilarse los datos de agotados?
R. Debe ajustarse al ciclo de respuesta. Si las decisiones se toman en la reunión matutina diaria, una vez al día es suficiente. Para categorías de productos cuyo inventario puede agotarse en menos de un día, se diseña una frecuencia mayor, pero al reducir el intervalo aumentan juntos el riesgo de bloqueo y el coste. El criterio no es el límite técnico, sino la velocidad de respuesta.
Conclusión
El diseño de un "informe matutino diario de productos nuevos·agotados" puede resumirse así.
- Guardar la lista de ayer — sin una instantánea de referencia no se pueden calcular ni los productos nuevos ni los agotados
- Definir qué se contará como producto nuevo·agotado — reglas para distinguir renovaciones·adición de opciones·reposiciones
- Calcular hacia atrás desde la hora de entrega — no dejar vacíos los espacios de validación y reintentos
- Dejar solo lo que debe revisarse hoy — un informe de 200 casos equivale a uno de 0 casos
El precio se lee; los productos nuevos y agotados se cuentan.
Para contar hace falta una regla de medir. La misma regla que ayer.
Lo que necesita no es la lista de productos de hoy. Es la diferencia entre ayer y hoy.
Una recopilación que no guarda el ayer perderá para siempre los productos nuevos de hoy.
Empezar ahora
Si nos indica los competidores·categorías que desea vigilar y la hora de entrega deseada, le ofreceremos gratuitamente un diagnóstico sobre la viabilidad de la recopilación y cómo definir las reglas de detección de productos nuevos·agotados. Al registrarse se proporcionan 50.000 créditos, para que pueda comprobar primero la calidad de los resultados.

.jpg?locale=es)


