ScrapeGraphAI — Sacar datos de webs diciéndole qué quieres (sin programar el extractor)
Una librería gratuita y de código abierto (para Python) que saca datos de páginas web sin que le indiques dónde está cada cosa: le describes qué información quieres y una IA la busca y te la devuelve ordenada. Sirve para listas de precios, contactos públicos o seguimiento de webs. Pide saber algo de Python y la IA que lee las páginas la pagas tú (o usas un modelo local).
Revisada el 2026-10-05
- Popularidad
- 32k
- Licencia
- MIT (código abierto)
- Autor
- ScrapeGraphAI (proyecto de código abierto; su web es scrapegraphai.com)
- Categoría
- Redes y datos
Seguridad: revisada
El contenido es seguro; el instalador o el servicio externo no se auditan aquí.
¿Qué es?
ScrapeGraphAI es una librería de Python (código abierto, gratis) que sirve para sacar datos de páginas web. La gracia es que no hay que programar «busca el precio aquí y el nombre allá»: le describes en lenguaje normal qué quieres («dame el nombre, el precio y la valoración de todos los productos de esta página») y una IA lee la página y te lo devuelve ordenado.
Se usa desde código (unas 5-10 líneas de Python), no es un programa con ventanas. Trae también una API, un servidor MCP (para conectarlo a Claude Code, Cursor y compañía) y encajes con n8n, Zapier, LangChain y otros.
¿Para qué es mejor
Para tres cosas, siempre con datos públicos:
- Listas y precios: comparar precios de la competencia, ver catálogos, seguir cambios de una web.
- Recopilar información de varias webs sin escribir un extractor para cada una (que es lo que cuesta tiempo).
- Alimentar a un agente: darle a tu IA de confianza una forma de leer webs de verdad, en vez de copiar y pegar.
Para una web suelta y puntual no merece la pena: es para cuando son muchas o cambian a menudo.
Cómo se instala (paso a paso)
- Instala Python 3.10 o superior (en python.org) y pip.
- Abre la terminal y instala la librería:
pip install scrapegraphai- Prepara una clave del modelo que vaya a leer las páginas (OpenAI, Gemini…) o un modelo local en tu ordenador con Ollama, para no pagar por uso.
- En un archivo de Python, dile la web y qué quieres sacar (en lenguaje normal) y ejecútalo.
- Si lo que buscas es conectarlo a tu agente, monta su servidor MCP en vez de programar: es la vía parecida a la del vídeo.
⚠️ Lo que hay que saber antes
- El vídeo dice «comenta CLAUDE y te envío la información». No hace falta comentar nada: el proyecto es público (GitHub) y su documentación está abierta. Eso sí, la web del autor es una comunidad de pago: se entiende el interés.
- Es una librería, no un programa con botones. Si no te manejas con Python, la vía cómoda es su servidor MCP o su nube de pago (más simple, pero de pago y con tus datos pasando por su servicio).
- La IA la pagas tú: cada página que lee gasta tokens de tu cuenta. Con un modelo local (Ollama) sale gratis, pero va más lento.
- Ojo con las reglas del scraping (lo más importante y lo que casi nunca se cuenta): mira las condiciones de uso de la web y su
robots.txt, no machaques con peticiones y, si guardas datos de personas (nombres, correos, teléfonos), tienes obligaciones legales (RGPD). De datos públicos en masa también se responde. - Comprobado por mí el 05/10/2026: 32.000 estrellas, licencia MIT, 32.779 descargas en el último mes. Proyecto vivo.
¿Es segura?
- Limpia*: es código abierto (MIT), se puede leer entero y no recoge nada por su cuenta; solo hace lo que le pides.
- El matiz: (1) lo que extrae se manda al modelo que elijas para que lo entienda, así que ahí manda la privacidad de ese proveedor; (2) usa tus claves; (3) el riesgo de verdad no es el programa, es qué webs rastreas y qué haces con los datos.
- Buenas prácticas: empieza por una web tuya o una que lo permita; pon pausas entre peticiones; guarda solo lo que necesites.