Cargando aplicación...
Preparando tu experiencia meskeIA
Visualiza por qué un test "99% preciso" puede dar más falsos positivos que verdaderos. La paradoja bayesiana en directo, con casos médicos reales.
Test rápido COVID: Antígenos en pico de incidencia (5%). Sensibilidad limitada vs PCR (~70-90%).
La fórmula que cambia tu intuición sobre tests, evidencia y diagnóstico
El teorema de Bayes calcula la probabilidad de una hipótesis (D) dada una evidencia observada (+), invirtiendo el condicional. Es una de las herramientas más potentes de toda la estadística aplicada:
Donde P(+) = P(+|D)·P(D) + P(+|¬D)·P(¬D) (regla de la probabilidad total). En el contexto de tests médicos:
La paradoja bayesiana surge porque P(+|D) ≠ P(D|+). Aunque la sensibilidad sea 99 %, si la prevalencia es muy baja, los falsos positivos pueden superar a los verdaderos: el VPP puede ser mucho menor de lo que parece.
| Prevalencia P(D) | De 10000 personas: enfermas | TP | FP | VPP = P(D|+) |
|---|---|---|---|---|
| 0,1 % (raro) | 10 | 9,5 | 500 | 1,87 % |
| 1 % | 100 | 95 | 495 | 16,1 % |
| 5 % | 500 | 475 | 475 | 50,0 % |
| 10 % | 1000 | 950 | 450 | 67,9 % |
| 50 % | 5000 | 4750 | 250 | 95,0 % |
Mismo test, prevalencias distintas, VPP radicalmente distintos. Por eso los tests indiscriminados en poblaciones de baja prevalencia generan tantos falsos positivos.
Cualquier test (PCR, mamografía, biopsia) tiene VPP que depende de la prevalencia local. Por eso los criterios de cribado masivo evitan poblaciones de muy baja prevalencia (más daño que beneficio por sobrediagnóstico).
Spam-Bayes y derivados clasifican correos calculando P(spam|palabras). Aprenden de cada email que marcas: actualizan los priors. Es de lejos el filtro más potente con datos limitados.
Pruebas forenses (ADN, huellas) tienen tasas de error que el jurado interpreta mal sin Bayes. La "falacia del fiscal": confundir P(prueba|inocente) con P(inocente|prueba). Errores graves cuando el sospechoso es uno entre miles.
Los clasificadores Naive Bayes, redes bayesianas y métodos bayesianos en general se basan directamente en el teorema. Es la base teórica de gran parte del aprendizaje supervisado moderno.
Porque cuando la prevalencia es muy baja, los falsos positivos arrasan. Si tienes 1 enfermo en 10000 sanos (prev 0,01 %) y un test 99 % preciso, te dará ~100 falsos positivos por cada verdadero positivo: VPP ≈ 1 %. El test "funciona bien", pero un positivo aislado significa muy poco.
💡 En el simulador, fija sensibilidad = 99 % y especificidad = 99 %, baja la prevalencia y mira cómo se desploma el VPP.
Depende del contexto. Sensibilidad alta es crucial cuando NO querer perder ningún caso es prioritario (cribado oncológico, COVID en pico). Especificidad alta es crucial cuando un falso positivo causa daño (biopsia innecesaria, alarma de drogas en deportistas). El equilibrio depende del coste de cada error.
💡 Curva ROC: la herramienta para visualizar el trade-off sensibilidad ↔ especificidad al variar el umbral.
Confundir P(evidencia|inocente) con P(inocente|evidencia). Si una prueba ADN tiene tasa de coincidencia 1 entre 1 millón en inocentes, y hay 30 millones de inocentes potenciales, podrías esperar ~30 coincidencias inocentes. La probabilidad de que el sospechoso concreto sea inocente NO es 1 entre 1 millón. Bayes lo corrige.
💡 Casos famosos como Sally Clark (UK) o el de Lucia de Berk (NL) tuvieron condenas con esta falacia que después fueron anuladas.
Porque dos tests independientes con el mismo positivo elevan muchísimo el VPP combinado. Si un primer test da 50 % VPP, hacer un segundo test independiente del 95 % de especificidad eleva el VPP combinado por encima del 95 %. Es Bayes aplicado iterativamente: el primer positivo es el nuevo prior del segundo test.
💡 Por eso un test rápido COVID positivo se confirmaba con PCR antes de tomar decisiones clínicas.
Frecuentista: probabilidad como frecuencia a largo plazo, no admite probabilidades sobre hipótesis. Bayesiana: probabilidad como grado de creencia, sí admite P(hipótesis). Bayes permite actualizar creencias con nueva evidencia (prior → posterior). Hoy se complementan; el debate filosófico está prácticamente cerrado.
💡 La inferencia bayesiana ha resurgido enormemente con la potencia de cálculo moderna (MCMC, computación). Stan, PyMC, brms son frameworks populares.
Prevalencia (cuántos enfermos hay), sensibilidad (qué % detecta), especificidad (qué % de sanos descarta). Sin estos 3, no se puede calcular VPP.
Filas: D / ¬D. Columnas: + / −. Calcula TP, FN, FP, TN. Es la forma más visual y menos propensa a errores que sustituir directamente en la fórmula.
Es el denominador del VPP. Representa cuántas personas darán positivo en total (verdaderos + falsos).
Esto es P(D|+): la probabilidad de estar enfermo dado que el test ha salido positivo. Es lo que el paciente quiere saber.
El VPP debe ser mayor que la prevalencia (un positivo elevó la probabilidad). Si la diferencia es pequeña (factor <5), el test aporta poco. Si es grande (factor >100), aporta mucho.
"De cada 1000 personas, 50 están enfermas" es más fácil de razonar que "P(D) = 0,05". Estudios de Gigerenzer y Hoffrage demuestran que las frecuencias mejoran la comprensión hasta un 80 %.
Un test puede tener sens 99 % y esp 50 %: muchísimos falsos positivos. O viceversa. Mira ambas SIEMPRE, no aceptes "tiene 99 % de precisión": ese término es ambiguo.
Un primer positivo vuelve el prior. Un segundo test calcula posterior usando ese prior. Aplicar Bayes iterativamente da VPPs combinados muy altos con dos tests independientes mediocres.
P(+) = P(+|D)·P(D) + P(+|¬D)·P(¬D). Si la suma de tus 4 categorías (TP+FN+FP+TN) no da el total, hay un error. Es la verificación más rápida.