{"id":19048,"date":"2026-08-13T05:21:33","date_gmt":"2026-08-13T08:21:33","guid":{"rendered":"https:\/\/rtmedical.com.br\/tmp-es-1786609292469\/"},"modified":"2026-08-13T05:21:40","modified_gmt":"2026-08-13T08:21:40","slug":"radiologo-error-llm-experiencia","status":"publish","type":"post","link":"https:\/\/rtmedical.com.br\/es\/radiologo-error-llm-experiencia\/","title":{"rendered":"La experiencia protege al radi\u00f3logo del error de IA"},"content":{"rendered":"<h2>La experiencia es lo que separa la ayuda de la trampa<\/h2>\n<p>Un estudio surcoreano publicado en <em>Radiology<\/em>, la revista principal de la RSNA, identific\u00f3 qu\u00e9 determina si un radi\u00f3logo gana o pierde al consultar un modelo de lenguaje: la confianza que expresa el propio modelo y, sobre todo, la experiencia del lector en la modalidad en cuesti\u00f3n. Cuando la explicaci\u00f3n del algoritmo est\u00e1 bien escrita pero el diagn\u00f3stico es incorrecto, quien tiene subespecializaci\u00f3n resiste; quien no la tiene, acepta. La calidad de la argumentaci\u00f3n, que deber\u00eda ser un beneficio, funciona en las dos direcciones.<\/p>\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" class=\"alignleft lazyload\" data-src=\"https:\/\/rtmedical.com.br\/wp-content\/uploads\/2026\/08\/radiologista-llm-sala-de-laudos.jpg\" alt=\"Radi\u00f3loga interpretando un estudio de imagen en un monitor diagn\u00f3stico en una sala de informes con poca luz\" width=\"620\" src=\"data:image\/svg+xml;base64,PHN2ZyB3aWR0aD0iMSIgaGVpZ2h0PSIxIiB4bWxucz0iaHR0cDovL3d3dy53My5vcmcvMjAwMC9zdmciPjwvc3ZnPg==\" style=\"--smush-placeholder-width: 1880px; --smush-placeholder-aspect-ratio: 1880\/1253;\"><figcaption>Consultar un LLM durante la lectura cambia la din\u00e1mica de decisi\u00f3n, y no siempre para mejor<\/figcaption><\/figure>\n<h2>C\u00f3mo se dise\u00f1\u00f3 el estudio<\/h2>\n<p>El trabajo, retrospectivo, fue conducido por Taehee Lee y colegas del Departamento de Radiolog\u00eda del Seoul National University Hospital y de la facultad de medicina de la misma universidad, y se public\u00f3 el 11 de agosto. Diez lectores interpretaron estudios de imagen tor\u00e1cica de 100 pacientes. Los casos provinieron de la plataforma Weekly Case de la Korean Society of Thoracic Radiology, con material de 2018 a 2020, incluyendo radiograf\u00edas, tomograf\u00edas, resonancias y PET.<\/p>\n<p>El dise\u00f1o tiene un detalle elegante: cada lector pas\u00f3 por dos sesiones. En la primera interpret\u00f3 sin asistencia alguna. En la segunda recibi\u00f3 apoyo de uno de dos modelos asignados al azar: uno de alta exactitud, con 76% de acierto, basado en GPT-5, y otro de baja exactitud, con 27%, basado en GPT-4o. Los lectores recib\u00edan opciones diagn\u00f3sticas de opci\u00f3n m\u00faltiple acompa\u00f1adas de las justificaciones del modelo, y el est\u00e1ndar de referencia lo estableci\u00f3 el autor de cada caso.<\/p>\n<p>Incluir deliberadamente un modelo malo es la parte m\u00e1s inteligente del protocolo. No alcanza con saber si la IA ayuda cuando acierta: la pregunta cl\u00ednicamente relevante es qu\u00e9 ocurre cuando se equivoca con soltura. Un modelo con 27% de exactitud falla en tres de cada cuatro casos y aun as\u00ed escribe con la misma fluidez que el modelo que acierta en tres de cada cuatro.<\/p>\n<h2>Las cifras: qui\u00e9n resiste y qui\u00e9n cede<\/h2>\n<p>Dos variables se asociaron de forma independiente con una interacci\u00f3n adecuada entre radi\u00f3logo y modelo: la confianza del modelo (raz\u00f3n de momios, u <em>odds ratio<\/em>, de 3,82) y la experiencia del lector (OR 2,06). Para quien no maneja el t\u00e9rmino, una raz\u00f3n de momios superior a 1 indica mayor probabilidad del desenlace; inferior a 1, menor. Un OR de 3,82 es un efecto fuerte.<\/p>\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" class=\"alignright lazyload\" data-src=\"https:\/\/rtmedical.com.br\/wp-content\/uploads\/2026\/08\/radiografia-torax-analise-medica.jpg\" alt=\"M\u00e9dica examinando una radiograf\u00eda de t\u00f3rax con hallazgos pulmonares a contraluz\" width=\"620\" src=\"data:image\/svg+xml;base64,PHN2ZyB3aWR0aD0iMSIgaGVpZ2h0PSIxIiB4bWxucz0iaHR0cDovL3d3dy53My5vcmcvMjAwMC9zdmciPjwvc3ZnPg==\" style=\"--smush-placeholder-width: 1880px; --smush-placeholder-aspect-ratio: 1880\/1253;\"><figcaption>Cien casos de imagen tor\u00e1cica \u2014radiograf\u00eda, TC, RM y PET\u2014 formaron la base de la evaluaci\u00f3n<\/figcaption><\/figure>\n<p>El efecto de la confianza del modelo, sin embargo, fue m\u00e1s d\u00e9bil entre los lectores expertos (OR 0,79). Tiene sentido: al especialista no lo impresiona el \u00e9nfasis. Ya tiene su propia hip\u00f3tesis y usa la salida del modelo como contrapunto, no como ancla.<\/p>\n<p>El hallazgo m\u00e1s inc\u00f3modo est\u00e1 en la calidad de la justificaci\u00f3n. Los argumentos mejor construidos redujeron el rechazo de sugerencias correctas (OR 0,79) \u2014bueno\u2014 pero aumentaron la aceptaci\u00f3n de sugerencias incorrectas (OR 1,71) \u2014malo\u2014. Es el mismo mecanismo operando en sentidos opuestos: una explicaci\u00f3n persuasiva persuade, con independencia de que sea correcta. Contra eso, dos factores resultaron protectores: la experiencia del lector (OR 0,54) y la confianza del propio lector en su hip\u00f3tesis (OR 0,80), ambos reduciendo la adhesi\u00f3n al error.<\/p>\n<h2>Qu\u00e9 concluyen los autores<\/h2>\n<p>La formulaci\u00f3n de los investigadores es precisa: \u00abAunque la alta confianza del modelo se asoci\u00f3 con decisiones correctas, la experiencia puede servir de salvaguarda frente a justificaciones persuasivas pero incorrectas. El papel de doble filo de la calidad de la justificaci\u00f3n sugiere que la explicabilidad beneficia a quienes pueden evaluarla cr\u00edticamente. En conjunto, la asistencia efectiva por LLM depende de factores que van m\u00e1s all\u00e1 del desempe\u00f1o del modelo, incluidas la experiencia del lector y la confianza del modelo.\u00bb<\/p>\n<p>Y avanzan m\u00e1s, en un pasaje que contradice la narrativa de sustituci\u00f3n: \u00abAdem\u00e1s de servir de salvaguarda, la experiencia del lector ancla la interacci\u00f3n humano-LLM. Dadas las limitaciones actuales de los modelos de visi\u00f3n y lenguaje, las descripciones elaboradas por expertos ayudan a guiar el razonamiento del modelo y reducen las alucinaciones. La experiencia tambi\u00e9n permite al cl\u00ednico formular preguntas focalizadas, evaluar las salidas y distinguir un razonamiento persuasivo pero mal fundamentado de explicaciones cl\u00ednicamente v\u00e1lidas. Lejos de disminuir el papel del radi\u00f3logo, los LLM amplifican la importancia de la experiencia cl\u00ednica, ya que el radi\u00f3logo moldea tanto las entradas como la interpretaci\u00f3n.\u00bb<\/p>\n<h2>Contexto t\u00e9cnico: por qu\u00e9 la fluidez enga\u00f1a<\/h2>\n<p>Conviene entender el mecanismo, porque no es un defecto pasajero de una versi\u00f3n de modelo. Un modelo de lenguaje se optimiza para producir texto plausible dado el contexto, no para se\u00f1alar su propia incertidumbre de forma calibrada. De ah\u00ed nacen los patrones que los radi\u00f3logos ya reconocen en la pr\u00e1ctica: explicaciones factualmente incorrectas presentadas con convicci\u00f3n indebida, omisi\u00f3n de un hallazgo relevante, generalizaci\u00f3n de patrones a partir de un caso at\u00edpico.<\/p>\n<p>El problema es que la percepci\u00f3n humana de competencia se apoya mucho en la fluidez. Un texto ordenado, con terminolog\u00eda correcta y estructura de razonamiento aparente, activa la misma heur\u00edstica que usamos para evaluar a un colega en una discusi\u00f3n de casos. Solo que el colega tiene un modelo del mundo detr\u00e1s de sus palabras y el LLM tiene una distribuci\u00f3n de probabilidad sobre tokens. Para quien domina el tema, la diferencia aparece en la primera inconsistencia anat\u00f3mica; para quien no lo domina, no aparece nunca.<\/p>\n<h2>Implicaciones pr\u00e1cticas para el servicio de imagen<\/h2>\n<p>La traducci\u00f3n operativa es concreta. Primero: la asistencia por LLM no deber\u00eda ofrecerse indiscriminadamente a residentes que trabajan fuera de su \u00e1rea de dominio. Es justamente la combinaci\u00f3n con mayor da\u00f1o documentado: baja experiencia m\u00e1s justificaci\u00f3n persuasiva.<\/p>\n<p>Segundo: el orden importa. Registrar la propia hip\u00f3tesis antes de consultar el modelo preserva la confianza del lector, que el estudio mostr\u00f3 protectora. Consultar primero y opinar despu\u00e9s le entrega el ancla al algoritmo.<\/p>\n<p>Tercero: la explicabilidad no es una salvaguarda universal. La industria vende \u00abIA explicable\u00bb como respuesta al problema de confianza, y este estudio muestra que la explicaci\u00f3n ayuda a quien puede criticarla y perjudica a quien no puede. En programas de residencia, eso sugiere entrenar expl\u00edcitamente la lectura cr\u00edtica de las salidas de modelo, igual que se entrena la lectura cr\u00edtica de un art\u00edculo cient\u00edfico.<\/p>\n<p>Hay un paralelo directo con lo que ya se discute en la comunicaci\u00f3n con pacientes. El ACR public\u00f3 <a href=\"https:\/\/rtmedical.com.br\/es\/acr-guia-resumenes-ia-paciente\/\">orientaciones sobre res\u00famenes de informes generados por IA<\/a> precisamente porque texto fluido y texto correcto no son lo mismo. Y el asunto gana urgencia al saber que <a href=\"https:\/\/rtmedical.com.br\/es\/informe-paciente-antes-medico\/\">44% de los informes llegan al paciente antes que al m\u00e9dico<\/a>: muchos ser\u00e1n interpretados con ayuda de un chatbot, sin ning\u00fan radi\u00f3logo en el circuito.<\/p>\n<h2>L\u00edmites y qu\u00e9 observar despu\u00e9s<\/h2>\n<p>Es un estudio retrospectivo, con diez lectores y casos curados de una plataforma educativa: material seleccionado por su valor did\u00e1ctico, t\u00edpicamente m\u00e1s dif\u00edcil y at\u00edpico que una lista de trabajo de rutina. Generalizarlo al volumen diario de un servicio general exige cautela. Tampoco se evaluaron desenlaces de pacientes, solo la concordancia con un est\u00e1ndar de referencia, y las versiones de modelo utilizadas envejecer\u00e1n r\u00e1pido.<\/p>\n<p>Aun as\u00ed, el mecanismo identificado tiende a sobrevivir a los cambios de versi\u00f3n, porque se deriva de c\u00f3mo est\u00e1n construidos estos sistemas y de c\u00f3mo los humanos juzgamos la competencia. La conclusi\u00f3n pr\u00e1ctica para quien trabaja con <a href=\"https:\/\/rtmedical.com.br\/es\/raidium-plataforma-imagen-oncologica\/\">plataformas de imagen oncol\u00f3gica con IA<\/a> o con cualquier herramienta generativa en el flujo diagn\u00f3stico es menos glamorosa que la promesa comercial: el valor de la herramienta es proporcional a la competencia de quien la opera. Cuanto mejor argumenta la IA, m\u00e1s experto necesita ser quien la escucha.<\/p>\n<p><strong>Fuente:<\/strong> <a href=\"https:\/\/radiologybusiness.com\/topics\/artificial-intelligence\/factors-make-radiologists-less-likely-be-fooled-large-language-models\" target=\"_blank\" rel=\"noopener\">Radiology Business<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Un estudio en Radiology muestra que las justificaciones persuasivas de LLM elevan la aceptaci\u00f3n de errores y la experiencia es el ant\u00eddoto.<\/p>\n","protected":false},"author":1,"featured_media":19018,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"om_disable_all_campaigns":false,"_monsterinsights_skip_tracking":false,"_monsterinsights_sitenote_active":false,"_monsterinsights_sitenote_note":"","_monsterinsights_sitenote_category":0,"ngg_post_thumbnail":0,"_rt_cluster":"","fifu_image_url":"","fifu_image_alt":"","footnotes":""},"categories":[229,183],"tags":[],"class_list":["post-19048","post","type-post","status-publish","format-standard","has-post-thumbnail","category-inteligencia-artificial-es","category-radiologia-es"],"aioseo_notices":[],"rt_seo":{"title":"","description":"Un estudio en Radiology muestra que las justificaciones persuasivas de LLM elevan la aceptaci\u00f3n de errores y la experiencia es el ant\u00eddoto.","canonical":"","og_image":"","robots":"index,follow","schema_type":"Article","include_in_llms":true,"llms_label":"La experiencia protege al radi\u00f3logo de errores de LLM","llms_summary":"Un estudio del Seoul National University Hospital publicado en Radiology con 10 lectores y 100 casos de imagen tor\u00e1cica hall\u00f3 que las justificaciones de mejor calidad aumentan la aceptaci\u00f3n de sugerencias incorrectas de LLM (OR 1,71), mientras la experiencia (OR 0,54) y la confianza del lector (OR 0,80) protegen.","faq_items":[],"video":[],"gtin":"","mpn":"","brand":"","aggregate_rating":[]},"_links":{"self":[{"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/posts\/19048\/"}],"collection":[{"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/posts\/"}],"about":[{"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/types\/post\/"}],"author":[{"embeddable":true,"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/users\/1\/"}],"replies":[{"embeddable":true,"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/comments\/?post=19048"}],"version-history":[{"count":1,"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/posts\/19048\/revisions\/"}],"predecessor-version":[{"id":19050,"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/posts\/19048\/revisions\/19050\/"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/media\/19018\/"}],"wp:attachment":[{"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/media\/?parent=19048"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/categories\/?post=19048"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/rtmedical.com.br\/es\/wp-json\/wp\/v2\/tags\/?post=19048"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}