Skip to main content

La pregunta que la mayoría de los hospitales hace antes de comprar inteligencia artificial para radiología es «¿qué algoritmo?». Según el radiólogo Anand Singh, en entrevista con Radiology Business, esa es la pregunta equivocada, o al menos la tercera de la fila. Antes vienen dos: qué problema queremos resolver y cómo vamos a medir éxito y valor una vez que el sistema esté en producción. Singh defiende que las instituciones adopten el concepto de «clinical AI stewardship» —una curaduría clínica permanente— y traten la IA como un ciclo de vida continuo, no como una compra con fecha de cierre.

Radiólogo revisando estudios de imagen en múltiples monitores de una estación de informe hospitalaria
El algoritmo entra en producción el día de la instalación. El trabajo de gestión empieza al día siguiente y no termina.

Medir el tiempo de informe no es medir valor

El tiempo de entrega y la productividad son las métricas de todo business case, y Singh reconoce que importan. El problema es que responden solo a una porción de la pregunta. Su lista de lo que debería entrar en la cuenta: capacidad instalada, acceso del paciente al examen, seguridad, consistencia entre lectores y los efectos aguas abajo en costo, ingresos y desenlace clínico.

La distinción es práctica. Un algoritmo de triaje que recorta 15 minutos en un estudio que ya se informaba en dos horas no cambió nada para el paciente. El mismo algoritmo aplicado a una cola de ictus, donde los minutos deciden la elegibilidad para trombólisis, lo cambia todo. Mismo producto, misma ganancia técnica, valores clínicos incomparables. Definir dónde importa la ganancia es una decisión de gestión, no del proveedor.

Plataforma o colección de aplicaciones

El segundo punto estratégico es cómo convivirán múltiples aplicaciones. Singh sostiene que un enfoque basado en plataforma reduce la fricción de interoperabilidad y simplifica el monitoreo y la gobernanza, mientras que la proliferación de herramientas independientes genera una deuda de gestión que crece sin que nadie lo note.

La aritmética es incómoda. Un sistema de salud con decenas de aplicaciones de IA debe monitorear cada una, entender los modos de fallo de cada una y sostener flujos de trabajo separados para cada una. Multiplíquelo por revalidación en cada cambio de versión, por contrato, por punto de integración con PACS y RIS. Una arquitectura común —detección, informe, calidad y seguridad bajo el mismo techo— no elimina el trabajo, pero lo vuelve finito.

La integración es la otra cara de la misma moneda: la IA que exige un login adicional, una alerta paralela o un paso extra en el flujo sencillamente no se usa. El radiólogo bajo presión de volumen esquiva cualquier cosa que cueste segundos por estudio. No es tecnofobia; es aritmética de guardia. Las herramientas que nacen dentro de la estación de informe parten con ventaja estructural sobre las que abren una ventana nueva.

Drift: cuando un algoritmo autorizado deja de funcionar sin avisar

Aquí está el argumento técnico más importante de la entrevista y el menos discutido en la sala de compras. Singh observa que los cambios en protocolos de imagen o en parámetros de adquisición pueden afectar el desempeño de un algoritmo. Conviene abrir el concepto.

Un modelo aprende la distribución de los datos con los que fue entrenado. Cuando esa distribución se mueve, el desempeño cae: es lo que la literatura llama dataset shift. La variante más común en radiología es el covariate shift: cambio de escáner, otro kernel de reconstrucción, adopción de reconstrucción iterativa o basada en deep learning, ajuste de dosis, cambio de fase de contraste, actualización de firmware. Nada de eso cambia el diagnóstico; todo eso cambia los píxeles. Existe además el concept drift, cuando se altera la propia relación entre imagen y desenlace: nueva población atendida, nuevo criterio diagnóstico.

El rasgo peligroso es el silencio. El modelo no emite error, no se cae, no avisa. Sigue devolviendo probabilidades con la misma cara de confianza y simplemente acierta menos. Sin medición continua, la caída aparece solo como un evento adverso aislado que nadie conecta con el algoritmo. Una señal de alerta barata y poco usada: seguir la tasa de positivos del algoritmo a lo largo del tiempo. Si el porcentaje de estudios marcados cambia sin que haya cambiado el perfil de pacientes, algo se movió, y conviene investigarlo antes de descubrirlo por la vía clínica.

La unidad de análisis es el par humano + IA

El monitoreo tradicional pregunta si el modelo sigue entregando la exactitud prometida. Singh sostiene que la pregunta debe ser más amplia: cómo va el desempeño del conjunto humano y máquina. No basta saber si el modelo acierta; hay que saber cómo interactúa el médico con su salida y si la tecnología alteró la decisión clínica de forma imprevista.

Dos efectos conocidos justifican la preocupación. El sesgo de automatización es la tendencia a aceptar la sugerencia de la máquina sin el escrutinio que se aplicaría a un colega, y crece cuanto mejor es el algoritmo, porque la confianza se calibra con la experiencia acumulada. Su espejo es la desensibilización: el exceso de falsos positivos entrena al lector para ignorar la alerta, incluso cuando acierta. En ambos casos la métrica aislada del modelo permanece intacta mientras el sistema sociotécnico se degrada. Ese desacople es el que apareció cuando la IA en mamografía rindió menos de lo prometido en el mundo real.

Infraestructura clínica, no solo infraestructura de TI

Singh insiste en que la IA no puede tratarse como un asunto exclusivo de TI: capacidad de cómputo, almacenamiento, nube y ciberseguridad. Lo que falta es infraestructura clínica: personas designadas para dar retroalimentación, revisar salidas, monitorear señales de seguridad y administrar la interacción entre humano y algoritmo. En la práctica eso significa validación local antes del go-live, monitoreo después, supervisión clínica con nombre y apellido, formación del equipo y un canal formal para reportar sospecha de fallo.

El marco externo va en la misma dirección. La FDA ya acepta planes predeterminados de control de cambios, que permiten al fabricante actualizar el modelo dentro de límites preaprobados, lo que traslada al servicio la carga de notar que la versión cambió. El ACR mantiene programas de registro y monitoreo posimplantación justamente para eso. Y el reglamento europeo de IA clasifica como de alto riesgo los sistemas embarcados en dispositivos médicos, con obligaciones de vigilancia posmercado escalonadas hasta 2027. El mensaje converge: autorizar pasó a ser el inicio del proceso, no el final, punto que la propia industria llevó al regulador cuando Radiology Partners pidió a la FDA reglas más claras de IA.

Las tres preguntas antes de firmar

Singh resume la decisión en tres preguntas que caben en una página: qué problema queremos resolver; cómo mediremos éxito y valor; y cómo escalaremos de forma responsable, administrando a la vez la tecnología y la interacción humano-IA. El hospital que no responde las tres antes de firmar las responderá después, en peores condiciones.

En América Latina el escenario suma una capa. En Brasil el software como dispositivo médico lo regula Anvisa y la legislación general de IA sigue en trámite en el Congreso, lo que deja al comprador sin una vara nacional consolidada de posmercado. Mientras tanto, la oferta crece rápido: la radiología ya concentra el 76% de todas las autorizaciones de dispositivos con IA de la FDA, y buena parte de ese catálogo llega por medio de representantes locales. Sin validación con datos locales —población, parque de equipos y protocolos distintos de los del entrenamiento—, la métrica del fabricante es una promesa, no una medida.

El camino de menor arrepentimiento es empezar pequeño y medible: un problema clínico definido, una línea de base registrada antes del go-live, un responsable clínico designado y una fecha fijada para reevaluar. Si el valor no aparece en el tablero, apagarlo es una decisión legítima, y barata, si el contrato lo previó.

Fuente: Radiology Business