METODOLOGÍA
Cómo funciona El Digestor
El Digestor lee en continuo 104 medios argentinos e internacionales de todo el espectro editorial, agrupa las coberturas de un mismo hecho y las convierte en una sola nota sintetizada, con todas las versiones a la vista. Esta página documenta el método completo — fórmulas, umbrales, compuertas de calidad y datos de operación reales — y se regenera todos los días. Quien quiera auditar cómo llegamos a cada número, acá tiene la respuesta.
1. Principios
- Sin línea editorial. No opinamos ni jerarquizamos por afinidad. El único juicio editorial que emitimos es la clasificación de fuentes — y está publicada, versionada y abierta a disputa (secciones 6 y 14).
- Todo atribuido. Cada nota es una pieza nueva cuya materia prima queda a la vista: la lista completa de artículos originales, con su medio, su orientación editorial y su hora, cada uno con link directo.
- La diversidad se mide, no se declama. Publicamos la fórmula, los umbrales y los números reales de operación. Ningún índice opaco: cada dato de esta página se puede recalcular.
- Automatización con compuertas. El pipeline es automático de punta a punta. Por eso los controles no son promesas de buena conducta: son compuertas estructurales. Lo que no las pasa, no se publica.
2. Qué no somos
- No somos un medio. No tenemos línea editorial ni sección de opinión. La única opinión que emite El Digestor es la metodología que estás leyendo.
- No somos un agregador de titulares. No listamos links sueltos: producimos una síntesis nueva y atribuida por cada hecho, además del listado completo de los artículos originales que la componen.
- No somos un fact-checker. No verificamos afirmaciones una por una. Mostramos cuántas líneas editoriales distintas cubren cada hecho, y descartamos automáticamente toda síntesis que cite fuentes que no están en el evento.
- No medimos "neutralidad". Ninguna fuente es neutral. Medimos diversidad editorial: cuántas voces distintas cubren cada hecho después de descontar reproducciones y medios de un mismo grupo.
3. El pipeline, paso a paso
- Ingesta (cada 30 min): leemos los RSS de las 104 fuentes activas. Se filtra ruido (horóscopo, lotería, clima), se descartan fechas de publicación inverosímiles — comunes en feeds agregados; en ese caso vale la hora real de ingesta — y las inserciones son idempotentes: el mismo artículo no entra dos veces. Rige además un tope de paridad: ninguna fuente puede aportar más de 20 artículos por ciclo, para que un medio de altísimo volumen no ahogue al resto del corpus.
- Vectorización (cada 5 min): cada artículo nuevo se convierte en un vector semántico con un modelo multilingüe auto-hosteado.
- Agrupamiento (cada 5 min): cada artículo busca el evento más cercano por distancia coseno sobre el centroide (umbral estricto: distancia ≤0,18, similitud ≥0,82), en una ventana de 48 horas. Un tope de miembros por evento (30) evita los "blobs" temáticos que mezclan hechos distintos.
- Adjudicación de identidad (Gate B): antes de que un artículo entre a un evento existente, un modelo de lenguaje compara su titular con los ya asignados y decide si es exactamente el mismo hecho — mismas personas, misma acción, mismo lugar y momento — o solo el mismo tema. Ante rechazo, duda o error, la decisión por defecto es conservadora: el artículo nunca contamina un evento ajeno, siembra uno nuevo.
- Detección de ecos: dentro de cada evento se comparan los textos entre sí (similitud de trigramas). Similitud ≥0,85 = reproducción del mismo despacho: se marca y se excluye del conteo de voces. Los medios de un mismo grupo (Clarín/TN, La Nación/LN+, etc.) colapsan a una sola voz editorial.
- Síntesis: los eventos con ≥2 voces distintas pasan a síntesis. El resultado es una nota nueva con atribución por afirmación: qué sostiene cada versión, y según qué medio.
- Compuertas de calidad: toda salida del modelo pasa por controles deterministas antes de publicarse (sección 10). Lo que no los pasa, no se publica.
- Imagen, con derechos: la imagen de cada nota sale de la imagen destacada del artículo que citamos (con crédito visible al medio), de repositorios con licencia libre, o de una tarjeta tipográfica propia. Nunca de un generador de imágenes (sección 11).
- Publicación: el sitio es HTML estático y es el mismo para todos — sin personalización, sin burbuja algorítmica. La historia principal se elige por recencia + diversidad (sección 8).
4. La métrica central: diversidad editorial
diversity_score = distinct_editorial_voices / all_outletsdonde distinct_editorial_voices = cantidad de medios distintos después de:
- excluir reproducciones textuales (similitud ≥0,85)
- colapsar medios de un mismo grupo (Clarín&TN, La Nación&LN+, Ámbito&Cronista) a una sola voz
Ejemplo: si un evento tiene 5 medios cubriéndolo, 2 son reproducciones de un tercero y 2 de los restantes pertenecen al mismo grupo: distinct = 2, all = 5, score = 0.4.
"Una sola voz" (la marca naranja en algunas notas) = distinct_voices = 1: cobertura editorial concentrada. No significa que el hecho sea falso ni manipulado. Significa que merece leerse sabiendo que ningún otro medio lo consideró relevante.
5. Puntos ciegos
Un punto ciego es un hecho que solo una parte del espectro decidió cubrir. Una noticia no necesita ser falsa para desinformar: alcanza con que nunca te llegue.
Cada nota muestra el desglose de sus fuentes por polo editorial (izquierda / centro / derecha). La banda de tendencias de la portada marca Punto Ciego cuando la cobertura reciente de un tema proviene de un solo polo. No decimos qué pensar de esa asimetría: la mostramos.
6. Cómo clasificamos las fuentes
Cada medio del corpus tiene dos lecturas complementarias:
- Orientación editorial (izquierda ↔ derecha): la etiqueta que ves como chip en cada nota. Es la base del desglose por polos y de los puntos ciegos.
- Mapa bi-axial: eje económico (izquierda ↔ derecha: postura ante la intervención del Estado, la redistribución, la regulación de mercados) por eje geopolítico (multipolar ↔ occidentalista: alineamiento internacional — simpatía con EE.UU./UE, con China/Rusia/BRICS, o mirada regional). Un solo eje se queda corto: dos medios pueden coincidir en economía y estar en las antípodas en política internacional.
La clasificación es manual y se asigna al incorporar cada fuente. Es un juicio editorial — el único que emitimos — y por eso es pública, versionada y discutible: si creés que un medio está mal clasificado, planteálo con tu argumento por el formulario del pie (sección 14). Se revisa a mano.
Mapa actual del corpus (98 de 104 medios activos clasificados en ambos ejes)
Cada punto = un medio. El cursor muestra el nombre.
7. El corpus, por orientación editorial
Estado actual del corpus Digestor AR (reference deployment). "En clasificación" agrupa medios incorporados recientemente — en su mayoría diarios provinciales — cuya revisión editorial todavía no cerró: sus artículos cuentan como voces en la síntesis, sin etiqueta de polo.
| Orientación | Fuentes |
|---|---|
| Izquierda | ANRed, Canal Abierto, Crisis, EcoPortal.net, El Cohete a la Luna, El Dipló, El Grito del Sur, Greenpeace Argentina, La Izquierda Diario, La Vaca / MU, Latfem (feminista + izquierda), Resumen Latinoamericano, TeleSUR, Tierra Viva, Tinta Limón, Tramas |
| Centroizquierda | Al Jazeera English, Bichos de Campo, Cenital, El Destape, Letra P, Nueva Sociedad, Página/12, REALPOLITIK, RedAcción, Revista Anfibia, Tiempo Argentino, Tiempo Sur (Patagonia) |
| Centro | AP en español, BBC Mundo, Crónica (Comodoro), Diario Norte (Chaco), Diario Uno (Mendoza), DW Latinoamérica, El Día (La Plata), El Litoral (Santa Fe), France 24 español, La Capital (Rosario), La Mañana de Neuquén, La Política Online, Reuters Argentina, Río Negro, TodoAgro |
| Centroderecha | Agritotal, Agroempresario, BAE Negocios, El Tribuno (Salta), Fortuna, Infocampo, La Gaceta (Tucumán), La Nueva (Bahía Blanca), La Voz del Campo, La Voz del Interior, Los Andes (Mendoza), Mendoza Post, Mercado, Pregón Agropecuario, Punto a Punto |
| Derecha | Clarín, Clarín Rural, Forbes Argentina, Infobae, IProfesional, La Nación, La Nación Campo, Perfil, TN |
| Prensa económica | Agrofy News, Ámbito, El Cronista |
| Estatal | Télam |
| En clasificación | ADN Río Negro (Viedma), Análisis Digital (Paraná, Entre Ríos), Chequeado, Corrientes Hoy, Diario Chaco, Diario de Cuyo (San Juan), Diario Época (Corrientes), Diario Formosa, Diario Jornada (Trelew, Chubut), Diario La Mañana (Formosa), Diario Pregón (Jujuy), El Ancasti (Catamarca), El Diario (Paraná, Entre Ríos), El Diario de la República (San Luis), El Diario del Fin del Mundo (Tierra del Fuego), El Esquiú (Catamarca), El Independiente (La Rioja), El Liberal (Santiago del Estero), El Sureño (Río Grande, Tierra del Fuego), El Territorio (Misiones), El Tribuno de Jujuy, El Tucumano, Informate Salta, La Arena (La Pampa), La Opinión Austral (Río Gallegos, Santa Cruz), La Reforma (General Pico, La Pampa), Mejor Informado (Neuquén), Misiones Online, Nueva Rioja (La Rioja), Nuevo Diario (Santiago del Estero), Reverso, San Luis 24, Tiempo de San Juan |
8. Cómo se arma cada nota y cómo se elige la portada
Cada nota muestra, además de la síntesis, la lista completa de artículos originales que la componen: favicon, medio, chip de orientación editorial y hora argentina, ordenados del más reciente al más antiguo, cada uno con link directo a la fuente.
La portada es la misma para todos los lectores. Para elegir la historia principal, los eventos se agrupan por niveles de antigüedad (menos de 24 h, menos de 48 h, más viejos) y dentro de cada nivel gana el que tenga más polos editoriales distintos cubriéndolo; la fecha exacta recién desempata al final. Eso evita dos fallas típicas: que una noticia vieja quede "pegada" arriba por la cobertura que tuvo en su momento, y que una nota fresca de un solo medio le gane a una con cobertura cruzada real.
Los temas visuales de cada producto cambian tipografía y color. Nunca contenido ni orden editorial.
9. Dónde interviene la IA — y dónde no
Modelos de lenguaje intervienen en exactamente dos puntos del pipeline, siempre detrás de compuertas:
- Adjudicación de identidad (Gate B): decidir si dos artículos hablan exactamente del mismo hecho. Ante duda o error, la decisión por defecto es conservadora: evento nuevo.
- Síntesis: escribir la nota a partir de los artículos del evento, con atribución por afirmación.
Cada tarea corre sobre una cadena redundante de modelos de varios proveedores independientes, con failover automático: si un proveedor se degrada, el siguiente toma la carga. Síntesis y adjudicación usan cadenas separadas para no competir por capacidad, y ningún proveedor concentra el volumen. Cada llamada queda registrada — modelo, latencia, resultado — y ese registro alimenta el control de la sección 10.
Dónde no hay IA: en las imágenes (nunca generativas — sección 11), en la clasificación de fuentes (manual — sección 6) y en la presentación: ninguna interfaz conversacional, ningún resumen sin fuentes. Cada afirmación remite a artículos reales que podés abrir.
Prompts versionados
Cada prompt de síntesis y de adjudicación se guarda con número de versión; las anteriores quedan como registro de auditoría. La versión activa es la que produce las notas de hoy.
| Tarea | Versión activa | Historial |
|---|---|---|
adjudicate_event_identity | v1 | — |
article_rewrite_es | v1 | — |
blindspot_digest | v1 | — |
daily_brief_synthesis_es | v1 | — |
extract_article | v1 | — |
synthesize_event | v9 | v1, v2, v5, v6, v7, v8 |
10. Control de calidad, en vivo
Toda salida de modelo pasa por compuertas deterministas antes de publicarse: esquema estructural válido, consistencia de fuentes — una síntesis que menciona un medio o una URL que no está entre las fuentes reales del evento se descarta entera — y el propio modelo puede objetar un agrupamiento que considera inválido. Lo retenido nunca llega al lector.
- Síntesis generadas (24 h)
- 561
- Retenidas por la compuerta
- 73 (13%)
Retenidas, por motivo
| Motivo | Casos (24 h) |
|---|---|
Citó un medio o URL ajenos al evento factual_inconsistency | 33 |
El propio modelo objetó el agrupamiento llm_rejected_cluster | 21 |
No cumplió el esquema estructural cco_schema_violation | 18 |
Salida no parseable cco_not_json | 1 |
El número de retenidas se lee como lo que es: el precio de publicar únicamente lo que pasa el control. Preferimos retener de más antes que publicar una síntesis que cite mal a un medio.
11. Uso del contenido de los medios
De cada artículo reproducimos, como máximo, un extracto breve (≤300 caracteres), siempre con atribución y link directo. Nunca la nota completa: quien quiere leer el original va al medio, y cada nota se lo facilita a propósito. Este uso se apoya en el derecho de cita — en Argentina, artículo 10 de la ley 11.723 — y en sus equivalentes regionales: extensión mínima, atribución, link a la fuente y una obra nueva que no sustituye a la original.
Imágenes. La imagen de cada nota proviene, en este orden, de: la imagen destacada del artículo que citamos, con crédito visible al medio; material con licencia libre (Wikimedia Commons y afines), atribuido; o una tarjeta tipográfica propia cuando ninguna de las anteriores tiene derechos claros. Nunca generamos imágenes con IA.
Si un medio prefiere que su contenido o su imagen destacada no aparezca en El Digestor, lo retiramos: basta pedirlo por el formulario del pie de esta página.
12. Datos de operación
- Eventos detectados desde 2026-06-17
- 82.332
- Sintetizados (≥2 voces distintas)
- 7.271
- Voces distintas por síntesis (promedio)
- 2,46
- Eco puro detectado (varios artículos, una sola voz)
- 3.299 — excluidos de síntesis
- Fuentes activas
- 104
Nota metodológica: no publicamos un "promedio de diversidad" sobre los eventos ya sintetizados — después de la compuerta de ≥2 voces, ese promedio da ~1,0 por construcción y no informa nada. El dato que sí informa es cuántos eventos quedaron afuera por ser una sola voz repetida en varios medios.
13. Privacidad: lo que no hacemos
- Sin rastreadores de terceros, ni en la web ni en el correo.
- La única medición es apertura y click, con tokens propios. No perfilamos lectores.
- No cruzamos tu email con datos de terceros ni lo vendemos. Nunca.
- Sin comentarios ni mecánica de red social: queremos lectores, no una arena.
- No verificamos afirmaciones individuales, no predecimos, no opinamos.
14. Corpus abierto y correcciones
El corpus no es una lista cerrada ni curada puertas adentro. Cualquiera puede proponer un medio desde el formulario de abajo — también está en la portada y en cada perfil de medio. Ninguna propuesta se activa sola: pasa por una validación técnica del feed y una revisión manual antes de sumarse; proponer no publica nada por sí solo. El criterio de entrada es simple: medios reales, con feed operativo, que ensanchen el espectro cubierto — sin filtro ideológico en la puerta de entrada.
El mismo formulario es el canal de correcciones y disputas: si encontraste un error en una nota, o creés que un medio está mal clasificado, dejá el link y tu argumento en el comentario. Se revisa a mano.
15. Quién está detrás
El Digestor es un proyecto independiente, operado de forma seudónima. Es una decisión deliberada, no un descuido: acá no hay firmas que pesen más que el método. El producto se evalúa por lo que se puede auditar — las fórmulas, los umbrales, los datos de operación y el comportamiento del pipeline, publicados en esta página. Lo que un nombre propio agregaría en confianza, lo tiene que ganar la metodología.