El Digestor

Una noticia, todas las fuentes.


METODOLOGÍA

Cómo funciona El Digestor

El Digestor lee en continuo 104 medios argentinos e internacionales de todo el espectro editorial, agrupa las coberturas de un mismo hecho y las convierte en una sola nota sintetizada, con todas las versiones a la vista. Esta página documenta el método completo — fórmulas, umbrales, compuertas de calidad y datos de operación reales — y se regenera todos los días. Quien quiera auditar cómo llegamos a cada número, acá tiene la respuesta.

1. Principios

2. Qué no somos

3. El pipeline, paso a paso

  1. Ingesta (cada 30 min): leemos los RSS de las 104 fuentes activas. Se filtra ruido (horóscopo, lotería, clima), se descartan fechas de publicación inverosímiles — comunes en feeds agregados; en ese caso vale la hora real de ingesta — y las inserciones son idempotentes: el mismo artículo no entra dos veces. Rige además un tope de paridad: ninguna fuente puede aportar más de 20 artículos por ciclo, para que un medio de altísimo volumen no ahogue al resto del corpus.
  2. Vectorización (cada 5 min): cada artículo nuevo se convierte en un vector semántico con un modelo multilingüe auto-hosteado.
  3. Agrupamiento (cada 5 min): cada artículo busca el evento más cercano por distancia coseno sobre el centroide (umbral estricto: distancia ≤0,18, similitud ≥0,82), en una ventana de 48 horas. Un tope de miembros por evento (30) evita los "blobs" temáticos que mezclan hechos distintos.
  4. Adjudicación de identidad (Gate B): antes de que un artículo entre a un evento existente, un modelo de lenguaje compara su titular con los ya asignados y decide si es exactamente el mismo hecho — mismas personas, misma acción, mismo lugar y momento — o solo el mismo tema. Ante rechazo, duda o error, la decisión por defecto es conservadora: el artículo nunca contamina un evento ajeno, siembra uno nuevo.
  5. Detección de ecos: dentro de cada evento se comparan los textos entre sí (similitud de trigramas). Similitud ≥0,85 = reproducción del mismo despacho: se marca y se excluye del conteo de voces. Los medios de un mismo grupo (Clarín/TN, La Nación/LN+, etc.) colapsan a una sola voz editorial.
  6. Síntesis: los eventos con ≥2 voces distintas pasan a síntesis. El resultado es una nota nueva con atribución por afirmación: qué sostiene cada versión, y según qué medio.
  7. Compuertas de calidad: toda salida del modelo pasa por controles deterministas antes de publicarse (sección 10). Lo que no los pasa, no se publica.
  8. Imagen, con derechos: la imagen de cada nota sale de la imagen destacada del artículo que citamos (con crédito visible al medio), de repositorios con licencia libre, o de una tarjeta tipográfica propia. Nunca de un generador de imágenes (sección 11).
  9. Publicación: el sitio es HTML estático y es el mismo para todos — sin personalización, sin burbuja algorítmica. La historia principal se elige por recencia + diversidad (sección 8).

4. La métrica central: diversidad editorial

diversity_score = distinct_editorial_voices / all_outlets

donde distinct_editorial_voices = cantidad de medios distintos después de:

  • excluir reproducciones textuales (similitud ≥0,85)
  • colapsar medios de un mismo grupo (Clarín&TN, La Nación&LN+, Ámbito&Cronista) a una sola voz

Ejemplo: si un evento tiene 5 medios cubriéndolo, 2 son reproducciones de un tercero y 2 de los restantes pertenecen al mismo grupo: distinct = 2, all = 5, score = 0.4.

"Una sola voz" (la marca naranja en algunas notas) = distinct_voices = 1: cobertura editorial concentrada. No significa que el hecho sea falso ni manipulado. Significa que merece leerse sabiendo que ningún otro medio lo consideró relevante.

5. Puntos ciegos

Un punto ciego es un hecho que solo una parte del espectro decidió cubrir. Una noticia no necesita ser falsa para desinformar: alcanza con que nunca te llegue.

Cada nota muestra el desglose de sus fuentes por polo editorial (izquierda / centro / derecha). La banda de tendencias de la portada marca Punto Ciego cuando la cobertura reciente de un tema proviene de un solo polo. No decimos qué pensar de esa asimetría: la mostramos.

6. Cómo clasificamos las fuentes

Cada medio del corpus tiene dos lecturas complementarias:

La clasificación es manual y se asigna al incorporar cada fuente. Es un juicio editorial — el único que emitimos — y por eso es pública, versionada y discutible: si creés que un medio está mal clasificado, planteálo con tu argumento por el formulario del pie (sección 14). Se revisa a mano.

Mapa actual del corpus (98 de 104 medios activos clasificados en ambos ejes)

izq der occidentalista multipolar ADN Río Negro (Viedma)AgritotalAgroempresarioAl Jazeera EnglishÁmbitoAnálisis Digital (Paraná, Entre Ríos)ANRedAP en españolBAE NegociosBBC MundoBichos de CampoCanal AbiertoCenitalClarínClarín RuralCorrientes HoyCrisisCrónica (Comodoro)Diario ChacoDiario de Cuyo (San Juan)Diario Época (Corrientes)Diario FormosaDiario Jornada (Trelew, Chubut)Diario La Mañana (Formosa)Diario Norte (Chaco)Diario Pregón (Jujuy)Diario Uno (Mendoza)DW LatinoaméricaEcoPortal.netEl Ancasti (Catamarca)El Cohete a la LunaEl CronistaEl DestapeEl Día (La Plata)El Diario (Paraná, Entre Ríos)El Diario de la República (San Luis)El Diario del Fin del Mundo (Tierra del Fuego)El DiplóEl Esquiú (Catamarca)El Grito del SurEl Independiente (La Rioja)El Liberal (Santiago del Estero)El Litoral (Santa Fe)El Sureño (Río Grande, Tierra del Fuego)El Territorio (Misiones)El Tribuno (Salta)El Tribuno de JujuyEl TucumanoForbes ArgentinaFortunaFrance 24 españolGreenpeace ArgentinaInfobaeInfocampoInformate SaltaIProfesionalLa Arena (La Pampa)La Capital (Rosario)La Gaceta (Tucumán)La Izquierda DiarioLa Mañana de NeuquénLa NaciónLa Nación CampoLa Nueva (Bahía Blanca)La Opinión Austral (Río Gallegos, Santa Cruz)La Política OnlineLa Reforma (General Pico, La Pampa)La Vaca / MULa Voz del CampoLa Voz del InteriorLatfem (feminista + izquierda)Letra PLos Andes (Mendoza)Mejor Informado (Neuquén)Mendoza PostMercadoMisiones OnlineNueva Rioja (La Rioja)Nueva SociedadNuevo Diario (Santiago del Estero)Página/12PerfilPregón AgropecuarioPunto a PuntoRedAcciónResumen LatinoamericanoReuters ArgentinaRevista AnfibiaRío NegroSan Luis 24TeleSURTiempo ArgentinoTiempo de San JuanTiempo Sur (Patagonia)Tierra VivaTinta LimónTNTramas

Cada punto = un medio. El cursor muestra el nombre.

7. El corpus, por orientación editorial

Estado actual del corpus Digestor AR (reference deployment). "En clasificación" agrupa medios incorporados recientemente — en su mayoría diarios provinciales — cuya revisión editorial todavía no cerró: sus artículos cuentan como voces en la síntesis, sin etiqueta de polo.

OrientaciónFuentes
IzquierdaANRed, Canal Abierto, Crisis, EcoPortal.net, El Cohete a la Luna, El Dipló, El Grito del Sur, Greenpeace Argentina, La Izquierda Diario, La Vaca / MU, Latfem (feminista + izquierda), Resumen Latinoamericano, TeleSUR, Tierra Viva, Tinta Limón, Tramas
CentroizquierdaAl Jazeera English, Bichos de Campo, Cenital, El Destape, Letra P, Nueva Sociedad, Página/12, REALPOLITIK, RedAcción, Revista Anfibia, Tiempo Argentino, Tiempo Sur (Patagonia)
CentroAP en español, BBC Mundo, Crónica (Comodoro), Diario Norte (Chaco), Diario Uno (Mendoza), DW Latinoamérica, El Día (La Plata), El Litoral (Santa Fe), France 24 español, La Capital (Rosario), La Mañana de Neuquén, La Política Online, Reuters Argentina, Río Negro, TodoAgro
CentroderechaAgritotal, Agroempresario, BAE Negocios, El Tribuno (Salta), Fortuna, Infocampo, La Gaceta (Tucumán), La Nueva (Bahía Blanca), La Voz del Campo, La Voz del Interior, Los Andes (Mendoza), Mendoza Post, Mercado, Pregón Agropecuario, Punto a Punto
DerechaClarín, Clarín Rural, Forbes Argentina, Infobae, IProfesional, La Nación, La Nación Campo, Perfil, TN
Prensa económicaAgrofy News, Ámbito, El Cronista
EstatalTélam
En clasificaciónADN Río Negro (Viedma), Análisis Digital (Paraná, Entre Ríos), Chequeado, Corrientes Hoy, Diario Chaco, Diario de Cuyo (San Juan), Diario Época (Corrientes), Diario Formosa, Diario Jornada (Trelew, Chubut), Diario La Mañana (Formosa), Diario Pregón (Jujuy), El Ancasti (Catamarca), El Diario (Paraná, Entre Ríos), El Diario de la República (San Luis), El Diario del Fin del Mundo (Tierra del Fuego), El Esquiú (Catamarca), El Independiente (La Rioja), El Liberal (Santiago del Estero), El Sureño (Río Grande, Tierra del Fuego), El Territorio (Misiones), El Tribuno de Jujuy, El Tucumano, Informate Salta, La Arena (La Pampa), La Opinión Austral (Río Gallegos, Santa Cruz), La Reforma (General Pico, La Pampa), Mejor Informado (Neuquén), Misiones Online, Nueva Rioja (La Rioja), Nuevo Diario (Santiago del Estero), Reverso, San Luis 24, Tiempo de San Juan

8. Cómo se arma cada nota y cómo se elige la portada

Cada nota muestra, además de la síntesis, la lista completa de artículos originales que la componen: favicon, medio, chip de orientación editorial y hora argentina, ordenados del más reciente al más antiguo, cada uno con link directo a la fuente.

La portada es la misma para todos los lectores. Para elegir la historia principal, los eventos se agrupan por niveles de antigüedad (menos de 24 h, menos de 48 h, más viejos) y dentro de cada nivel gana el que tenga más polos editoriales distintos cubriéndolo; la fecha exacta recién desempata al final. Eso evita dos fallas típicas: que una noticia vieja quede "pegada" arriba por la cobertura que tuvo en su momento, y que una nota fresca de un solo medio le gane a una con cobertura cruzada real.

Los temas visuales de cada producto cambian tipografía y color. Nunca contenido ni orden editorial.

9. Dónde interviene la IA — y dónde no

Modelos de lenguaje intervienen en exactamente dos puntos del pipeline, siempre detrás de compuertas:

Cada tarea corre sobre una cadena redundante de modelos de varios proveedores independientes, con failover automático: si un proveedor se degrada, el siguiente toma la carga. Síntesis y adjudicación usan cadenas separadas para no competir por capacidad, y ningún proveedor concentra el volumen. Cada llamada queda registrada — modelo, latencia, resultado — y ese registro alimenta el control de la sección 10.

Dónde no hay IA: en las imágenes (nunca generativas — sección 11), en la clasificación de fuentes (manual — sección 6) y en la presentación: ninguna interfaz conversacional, ningún resumen sin fuentes. Cada afirmación remite a artículos reales que podés abrir.

Prompts versionados

Cada prompt de síntesis y de adjudicación se guarda con número de versión; las anteriores quedan como registro de auditoría. La versión activa es la que produce las notas de hoy.

TareaVersión activaHistorial
adjudicate_event_identityv1
article_rewrite_esv1
blindspot_digestv1
daily_brief_synthesis_esv1
extract_articlev1
synthesize_eventv9v1, v2, v5, v6, v7, v8

10. Control de calidad, en vivo

Toda salida de modelo pasa por compuertas deterministas antes de publicarse: esquema estructural válido, consistencia de fuentes — una síntesis que menciona un medio o una URL que no está entre las fuentes reales del evento se descarta entera — y el propio modelo puede objetar un agrupamiento que considera inválido. Lo retenido nunca llega al lector.

Síntesis generadas (24 h)
561
Retenidas por la compuerta
73 (13%)

Retenidas, por motivo

MotivoCasos (24 h)
Citó un medio o URL ajenos al evento factual_inconsistency33
El propio modelo objetó el agrupamiento llm_rejected_cluster21
No cumplió el esquema estructural cco_schema_violation18
Salida no parseable cco_not_json1

El número de retenidas se lee como lo que es: el precio de publicar únicamente lo que pasa el control. Preferimos retener de más antes que publicar una síntesis que cite mal a un medio.

11. Uso del contenido de los medios

De cada artículo reproducimos, como máximo, un extracto breve (≤300 caracteres), siempre con atribución y link directo. Nunca la nota completa: quien quiere leer el original va al medio, y cada nota se lo facilita a propósito. Este uso se apoya en el derecho de cita — en Argentina, artículo 10 de la ley 11.723 — y en sus equivalentes regionales: extensión mínima, atribución, link a la fuente y una obra nueva que no sustituye a la original.

Imágenes. La imagen de cada nota proviene, en este orden, de: la imagen destacada del artículo que citamos, con crédito visible al medio; material con licencia libre (Wikimedia Commons y afines), atribuido; o una tarjeta tipográfica propia cuando ninguna de las anteriores tiene derechos claros. Nunca generamos imágenes con IA.

Si un medio prefiere que su contenido o su imagen destacada no aparezca en El Digestor, lo retiramos: basta pedirlo por el formulario del pie de esta página.

12. Datos de operación

Eventos detectados desde 2026-06-17
82.332
Sintetizados (≥2 voces distintas)
7.271
Voces distintas por síntesis (promedio)
2,46
Eco puro detectado (varios artículos, una sola voz)
3.299 — excluidos de síntesis
Fuentes activas
104

Nota metodológica: no publicamos un "promedio de diversidad" sobre los eventos ya sintetizados — después de la compuerta de ≥2 voces, ese promedio da ~1,0 por construcción y no informa nada. El dato que sí informa es cuántos eventos quedaron afuera por ser una sola voz repetida en varios medios.

13. Privacidad: lo que no hacemos

14. Corpus abierto y correcciones

El corpus no es una lista cerrada ni curada puertas adentro. Cualquiera puede proponer un medio desde el formulario de abajo — también está en la portada y en cada perfil de medio. Ninguna propuesta se activa sola: pasa por una validación técnica del feed y una revisión manual antes de sumarse; proponer no publica nada por sí solo. El criterio de entrada es simple: medios reales, con feed operativo, que ensanchen el espectro cubierto — sin filtro ideológico en la puerta de entrada.

El mismo formulario es el canal de correcciones y disputas: si encontraste un error en una nota, o creés que un medio está mal clasificado, dejá el link y tu argumento en el comentario. Se revisa a mano.

15. Quién está detrás

El Digestor es un proyecto independiente, operado de forma seudónima. Es una decisión deliberada, no un descuido: acá no hay firmas que pesen más que el método. El producto se evalúa por lo que se puede auditar — las fórmulas, los umbrales, los datos de operación y el comportamiento del pipeline, publicados en esta página. Lo que un nombre propio agregaría en confianza, lo tiene que ganar la metodología.

¿Falta un medio?

El corpus es abierto por diseño: cualquiera puede proponer una fuente para que la sumemos.