Recolección vía feedparser desde 16 fuentes RSS en 7 países (ES, US, FR, UK, IT, DE, BR). Política de rate limiting con backoff exponencial + jitter para no saturar servidores. Cache TTL de 30 minutos.
Los titulares se vectorizan mediante TF-IDF char-wb ngrams(2,4) en 500 dimensiones. Se aplica HDBSCAN con min_cluster_size=2 para capturar tanto temas principales como pares de noticias relacionadas. Los puntos etiquetados como -1 son ruido no agrupado.
Se calcula la similitud coseno entre todos los pares de embeddings. Si la similitud supera el umbral (threshold=0.75), se agrupan como una misma noticia cubierta por múltiples fuentes. Los editoriales se detectan por patrones de texto ("editorial", "opinión", columnistas conocidos).
Extracción de palabras clave por título filtrando stopwords multilingüe (ES, EN, FR, IT, PT, DE). Se computan ventanas de 3, 5 y 7 días para identificar términos persistentes. Los trending terms se calculan como ratio entre ventanas para detectar palabras en ascenso.
Python 3.12 · SQLite (WAL mode) · scikit-learn · Jinja2 · Groq/Gemini APIs · Deploy: GitHub Pages + rsync · PWA
Alcance del scraping: Este sistema recolecta únicamente titulares y enlaces de fuentes RSS públicas. No extrae el cuerpo completo de los artículos, no vulnera paywalls, ni accede a contenido restringido. Cada feed se consulta con rate limiting (mínimo 15 min entre requests) y User-Agent identificativo, respetando los términos de servicio de cada fuente.
Derechos de autor: Los titulares y enlaces pertenecen a sus respectivos medios. Este proyecto no almacena ni reproduce contenido protegido más allá del título y la URL, operando bajo el principio de fair use / cita con fines de agregación y análisis.
Fiabilidad del análisis: El clustering, detección de sincronizadas y extracción de entidades son procesos automáticos basados en similitud estadística (TF-IDF + HDBSCAN). Pueden generar falsos positivos (noticias agrupadas incorrectamente) y falsos negativos (noticias relacionadas no detectadas). Las etiquetas LLM son generadas por IA y deben verificarse. Este sistema es una herramienta de exploración, no una fuente definitiva de verdad.
Privacidad: No se recopilan datos personales de usuarios. El contador de visitas es anónimo. No se usan cookies ni tracking.
⸻ Use este sistema con responsabilidad. Verifique siempre la información con fuentes primarias.
Intelligence Hub es un sistema de agregación y análisis de noticias geopolíticas. Recolecta titulares de medios de comunicación de 7 países, detecta patrones y relaciones entre fuentes, y genera briefings automáticos diarios.
El proyecto surgió como una evolución de daily_readings (originalmente en Raspberry Pi vía org-mode + GitHub Pages), migrado a un stack Python moderno con capacidad de clustering y análisis semántico.
📱 PWA: Este sitio es instalable como app en móviles y tablets. Desde Chrome pulsa "Añadir a pantalla de inicio"; desde Safari usa el botón Compartir. Funciona offline parcial gracias al service worker.
Aviso legal: Este sitio opera bajo el derecho de cita (art. 32 LPI). No almacena ni reproduce contenido protegido más allá de titulares y enlaces. No tiene fines comerciales. Las marcas, logotipos y contenidos enlazados pertenecen a sus respectivos propietarios.
Tecnologías:
Autor: El Mapa y El Código · news@viajeinteligencia.com
Ecosistema: viajeinteligencia.com