A pergunta que a maioria dos hospitais faz antes de comprar inteligência artificial para radiologia é “qual algoritmo?”. Segundo o radiologista Anand Singh, em entrevista à Radiology Business, essa é a pergunta errada — ou pelo menos a terceira da fila. Antes dela vêm duas: que problema estamos tentando resolver, e como vamos medir sucesso e valor depois que o sistema entrar em produção. Singh defende que as instituições adotem o conceito de “clinical AI stewardship” — uma função de curadoria clínica permanente — e tratem a IA como um ciclo de vida contínuo, não como uma aquisição com data de encerramento.

Medir tempo de laudo não é medir valor
Tempo de turnaround e produtividade são as métricas que aparecem em todo business case, e Singh reconhece que importam. O problema é que elas respondem só a uma fatia da pergunta. Ele lista o que deveria entrar na conta: capacidade instalada, acesso do paciente ao exame, segurança, consistência entre leitores, e os efeitos a jusante em custo, receita e desfecho clínico.
A distinção é prática. Um algoritmo de triagem que corta 15 minutos no tempo de laudo de um exame que já saía em duas horas não mudou nada para o paciente. O mesmo algoritmo aplicado a uma fila de AVC, onde minutos definem elegibilidade para trombólise, muda tudo. São o mesmo produto e o mesmo ganho técnico, com valores clínicos incomparáveis. Definir onde o ganho importa é decisão de gestão, não de fornecedor.
Plataforma ou coleção de aplicativos
O segundo ponto estratégico é como múltiplas aplicações vão conviver. Singh argumenta que uma abordagem baseada em plataforma reduz atrito de interoperabilidade e simplifica monitoramento e governança, enquanto a proliferação de ferramentas independentes cria uma dívida de gestão que cresce sem que ninguém perceba.
A matemática é desconfortável. Um sistema de saúde com dezenas de aplicações de IA precisa monitorar cada uma, entender os modos de falha de cada uma e sustentar fluxos de trabalho separados para cada uma. Multiplique por revalidação a cada atualização de versão, por contrato, por ponto de integração com PACS e RIS. Uma arquitetura comum — detecção, laudo, qualidade e segurança sob o mesmo teto — não elimina o trabalho, mas o torna finito.
Integração é o outro lado da mesma moeda: IA que exige login adicional, alerta paralelo ou passo extra no fluxo simplesmente não é usada. O radiologista sob pressão de volume contorna qualquer coisa que custe segundos por exame. Não é resistência à tecnologia; é aritmética de plantão. Ferramentas que nascem dentro da estação de laudo, como no caso em que a NewVue integrou o laudo ao cockpit do radiologista, partem de uma vantagem estrutural sobre as que pedem uma janela nova.
Drift: quando um algoritmo aprovado para de funcionar sem avisar
Aqui está o argumento técnico mais importante da entrevista, e o menos discutido em sala de compras. Singh observa que mudanças em protocolos de imagem ou em parâmetros de aquisição podem afetar o desempenho de um algoritmo. Vale abrir o conceito.
Um modelo aprende a distribuição dos dados com que foi treinado. Quando essa distribuição muda, o desempenho cai — é o que a literatura chama de dataset shift. A variante mais comum na radiologia é o covariate shift: troca de scanner, mudança de kernel de reconstrução, adoção de reconstrução iterativa ou baseada em deep learning, ajuste de dose, mudança de fase de contraste, atualização de firmware. Nada disso muda o diagnóstico; tudo isso muda os pixels. Há ainda o concept drift, quando a própria relação entre imagem e desfecho se altera — nova população atendida, novo critério diagnóstico.
O traço perigoso é o silêncio. O modelo não emite erro, não trava, não avisa. Ele continua devolvendo probabilidades com a mesma cara de confiança e simplesmente acerta menos. Sem medição contínua, a queda só aparece como um evento adverso isolado que ninguém conecta ao algoritmo. Um sinal de alerta barato e subutilizado: acompanhar a taxa de positivos do algoritmo ao longo do tempo. Se o percentual de exames marcados muda sem que o perfil de pacientes tenha mudado, alguma coisa se moveu — e vale investigar antes de descobrir pela via clínica.
A unidade de análise é o par humano + IA
O monitoramento tradicional pergunta se o modelo continua entregando a acurácia prometida. Singh sustenta que a pergunta precisa ser mais larga: como está o desempenho do conjunto humano e máquina. Não basta saber se o modelo acerta; é preciso saber como o médico interage com a saída dele e se a tecnologia alterou a decisão clínica de forma não prevista.
Dois efeitos conhecidos justificam a preocupação. O viés de automação é a tendência de aceitar a sugestão da máquina sem o escrutínio que se aplicaria a um colega — e ele aumenta quanto melhor o algoritmo é, porque a confiança se calibra pela experiência acumulada. O efeito espelho é a dessensibilização: excesso de falsos-positivos treina o leitor a ignorar o alerta, inclusive quando ele está certo. Nos dois casos, a métrica isolada do modelo permanece intacta enquanto o sistema sociotécnico degrada. Foi esse descolamento que apareceu quando a IA em mamografia rendeu menos no mundo real do que nos estudos de validação.
Infraestrutura clínica, não só infraestrutura de TI
Singh insiste que IA não pode ser tratada como assunto exclusivo de TI — capacidade computacional, armazenamento, nuvem e cibersegurança. O que falta é infraestrutura clínica: gente designada para dar feedback, revisar saídas, monitorar sinais de segurança e administrar a interação entre humano e algoritmo. Na prática, isso significa validação local antes do go-live, monitoramento depois, supervisão clínica nomeada, treinamento de equipe e um canal formal para reportar suspeita de falha.
O arcabouço externo caminha na mesma direção. A FDA passou a aceitar planos de controle de mudanças predeterminados (PCCP), que permitem ao fabricante atualizar o modelo dentro de limites pré-aprovados — o que transfere ao serviço a responsabilidade de perceber que a versão mudou. O ACR mantém programas de registro e monitoramento pós-implantação justamente para isso. E o regulamento europeu de IA classifica sistemas embarcados em dispositivos médicos como de alto risco, com obrigações de monitoramento pós-mercado escalonadas até 2027. O recado é convergente: autorizar virou o começo do processo, não o fim — ponto que a própria indústria tem levado ao regulador, como quando a Radiology Partners pediu à FDA regras mais claras para IA em imagem.
As três perguntas antes da assinatura
Singh resume a decisão em três perguntas que cabem numa página: que problema queremos resolver; como vamos medir sucesso e valor; e como vamos escalar de forma responsável, administrando ao mesmo tempo a tecnologia e a interação humano-IA. Hospital que não responde às três antes de assinar vai responder depois, em condições piores.
No Brasil o cenário adiciona uma camada. Software como dispositivo médico é regulado pela Anvisa, e a regulação geral de IA ainda tramita no Congresso, o que deixa o contratante sem uma régua nacional consolidada de pós-mercado. Ao mesmo tempo, a oferta cresce rápido: a radiologia já concentra 76% de todas as autorizações de dispositivos com IA da FDA, e boa parte desse catálogo chega por aqui via representante. Sem validação em dados locais — população, parque de equipamentos e protocolos diferentes daqueles do treinamento — a métrica do fabricante é uma promessa, não uma medida.
O caminho de menor arrependimento é começar pequeno e medível: um problema clínico definido, uma linha de base registrada antes do go-live, um responsável clínico nomeado e uma data marcada para reavaliar. Se o valor não aparecer no painel, desligar é uma decisão legítima — e barata, se tiver sido prevista em contrato.
Fonte: Radiology Business




