Estándar de evidencia diagnóstica de la serie MED
Alcance
Este contrato regula expedientes educativos sobre pruebas, reglas, modelos y estrategias de detección, diagnóstico, cribado y estadificación. No recibe datos de pacientes, no interpreta resultados personales, no calcula probabilidades individuales y no indica estudios, derivaciones o tratamientos.
Unidad mínima de una afirmación diagnóstica
Toda afirmación debe declarar:
- propósito: detección, descarte, confirmación, cribado, estadificación, monitorización o predicción;
- población y escenario clínico antes de conocer el resultado;
- prueba índice, versión, umbral, lector, muestra y momento;
- comparador y lugar de la prueba dentro de la ruta existente;
- condición objetivo y definición operativa;
- estándar de referencia, cegamiento, intervalo temporal y verificaciones diferenciales;
- resultados no concluyentes, fallos técnicos y datos faltantes;
- sensibilidad y especificidad con intervalos para el umbral declarado;
- prevalencia o probabilidad previa cuando se comuniquen valores predictivos o probabilidades posteriores;
- acciones posteriores y consecuencias de falsos positivos, falsos negativos, sobrediagnóstico y hallazgos incidentales;
- validación externa, calibración y subgrupos pertinentes cuando se trate de un modelo;
- beneficio o daño para pacientes cuando se afirme utilidad clínica.
Separaciones obligatorias
- Resultado no equivale a condición. La prueba aporta información; no observa una verdad sin error.
- Exactitud no equivale a utilidad. Sensibilidad, especificidad o AUC no demuestran mejores decisiones o desenlaces.
- Referencia no equivale a infalibilidad. Patología, imagen, seguimiento, consenso o respuesta terapéutica pueden clasificar con error y de forma dependiente.
- Sensibilidad y especificidad no son propiedades universales. Umbral, espectro, escenario, ejecución y definición de la condición pueden modificarlas.
- Valor predictivo no viaja solo. Depende de la frecuencia de la condición y de cómo se seleccionó la población.
- Clasificación no equivale a predicción calibrada. Un modelo puede discriminar y asignar probabilidades sistemáticamente erróneas.
- Reporte no equivale a validez. STARD, STARD-AI, TRIPOD+AI y PRISMA-DTA transparentan; QUADAS-3 y PROBAST+AI ayudan a juzgar sesgo y aplicabilidad.
Diseños y controles mínimos
- cohortes consecutivas o aleatorias representativas del uso previsto;
- especificación previa de umbral y manejo de resultados indeterminados;
- prueba índice interpretada sin conocer la referencia y viceversa cuando proceda;
- referencia aplicada de forma comparable o corrección/sensibilidad explícita si no es posible;
- flujo completo desde elegibilidad hasta análisis;
- comparaciones pareadas o aleatorizadas cuando se afirme superioridad entre rutas;
- estudios de manejo o ensayos prueba–tratamiento cuando la inferencia llegue a decisiones y desenlaces;
- validación temporal o geográfica externa, calibración y vigilancia de deriva para modelos desplegados;
- análisis de accesibilidad y desempeño por grupos sin convertir subgrupos pequeños en conclusiones firmes.
Lenguaje público
Se dirá «clasificó», «estimó», «fue compatible con», «redujo pruebas posteriores» o «no demostró beneficio» bajo una población, umbral y ruta. Se evitarán «detecta todo», «descarta», «confirma», «gold standard», «inteligencia superior» y «salva vidas» sin el puente empírico correspondiente.
Frontera de seguridad
Los ejemplos publicados son expedientes metodológicos históricos. No deben reutilizarse como instrucciones clínicas actuales. Cualquier decisión real exige la guía vigente, el contexto completo y el equipo tratante.