Por qué la IA determinista supera a los LLMs en decisiones clínicas
Los modelos de lenguaje alucinan. En medicina clínica, una alucinación no es un fallo interesante — es un diagnóstico erróneo, una interacción farmacológica peligrosa o una señal de alarma perdida. Medicus 24/7 no usa LLMs para decisiones clínicas. Aquí explico por qué.
El entusiasmo por los modelos de lenguaje en salud sigue un patrón predecible. Un equipo de investigación ajusta un modelo con literatura médica, lo prueba contra un examen estandarizado, publica un paper mostrando que obtiene puntajes comparables a médicos, y comienza el ciclo de prensa. Lo que estos benchmarks fallan consistentemente en medir es lo que más importa en la práctica clínica: el costo de equivocarse.
El problema de alucinaciones no tiene solución
La alucinación de los LLM no es un bug que se corregirá en la próxima versión. Es una propiedad estructural de cómo funcionan estos modelos. Un transformer predice el siguiente token basándose en patrones estadísticos de sus datos de entrenamiento. Cuando el modelo encuentra un escenario clínico entre patrones bien representados, interpola — y esa interpolación puede producir resultados fluidos, seguros y erróneos.
En un chatbot de servicio al cliente, una alucinación significa una política de devoluciones ligeramente incorrecta. En un sistema de soporte a decisiones clínicas, una alucinación significa recomendar un medicamento contraindicado a un paciente con insuficiencia renal. Las distribuciones de probabilidad son idénticas. Las consecuencias no.
Qué significa determinístico en la práctica
Los módulos clínicos de Medicus 24/7 no usan LLMs para enrutamiento diagnóstico. Usan árboles de decisión basados en reglas construidos directamente de las Guías de Práctica Clínica (GPCs) oficiales de México, publicadas por el IMSS. Cada nodo de decisión mapea a una recomendación específica de la GPC con su nivel de evidencia y grado de recomendación.
Patient presents with:
- Sore throat: true
- Fever > 38°C: true
- Tonsillar exudate: true
- Centor score: 3
GPC lookup: IMSS-073-08, Recommendation 4.2.1
→ Evidence level: Ia
→ Recommendation grade: A
→ Action: Rapid strep test + empiric antibiotics
Route: bacterial_pharyngitis_treatment
Confidence: deterministic (not probabilistic)
Traceable to: GPC node 4.2.1
No hay distribución de probabilidad aquí. No hay parámetro de temperatura. El sistema no "cree" que el paciente tiene faringitis — evalúa datos clínicos estructurados contra un conjunto fijo de reglas y devuelve la ruta correspondiente. El resultado es el mismo cada vez para la misma entrada. Es auditable, reproducible y trazable a la guía específica que lo justifica.
Dónde sí pertenecen los LLMs
Este no es un argumento contra los LLMs en salud. Es un argumento sobre dónde pertenecen. En Medicus, los LLMs manejan procesamiento de lenguaje natural: transcripción de dictado médico via Whisper, extracción de datos clínicos estructurados de notas libres, generación de documentación SOAP. Son tareas de lenguaje — tareas donde la naturaleza probabilística del modelo es una ventaja, no un riesgo.
La arquitectura está dividida deliberadamente: los LLMs procesan lenguaje, los motores determinísticos toman decisiones clínicas. La salida del LLM alimenta al motor de reglas como datos estructurados. El motor de reglas nunca recibe salida cruda del modelo como entrada clínica. Esta frontera se impone en código, no por convención.
137 viñetas de seguridad, cero fallos
Cada módulo clínico en Medicus se somete a pruebas de seguridad con viñetas diseñadas clínicamente — escenarios sintéticos de pacientes construidos específicamente para activar casos límite, contraindicaciones y trampas diagnósticas. El módulo de faringitis tiene 16 viñetas. Rinitis tiene 11. Sinusitis tiene 14. Cada viñeta es una prueba que el sistema debe aprobar con la ruta correcta, la referencia GPC correcta y la acción clínica correcta.
Al momento de escribir esto, Medicus ha pasado más de 137 viñetas de seguridad en todos los módulos clínicos con cero fallos. No porque el sistema sea perfecto, sino porque los sistemas determinísticos fallan de forma predecible — y los fallos predecibles se pueden probar exhaustivamente. No se puede probar exhaustivamente un sistema probabilístico porque su espacio de salida es ilimitado.
La pregunta incómoda
Si estás evaluando un sistema de IA clínica, haz una pregunta: ¿puedes mostrarme la regla exacta que produjo esta recomendación, trazada hasta la guía clínica específica y su nivel de evidencia?
Si la respuesta involucra embeddings, pesos de atención, o "el modelo fue entrenado con literatura médica," estás viendo un sistema que no puede explicarse en términos que un médico aceptaría en una demanda por mala praxis. Y si no puede sobrevivir a una demanda, no debería estar tomando decisiones clínicas.
¿Quieres ver la IA clínica determinista en acción? Agendemos una demo →