LLMs Multimodales vs. DINOv2
El choque de los titanes fundacionales en la clasificación de radiografías médicas.
El Nuevo Reto: PneumoniaMNIST
Dejamos temporalmente nuestro panel oscuro para validar estrategias con un clásico médico: PneumoniaMNIST. El objetivo es clasificar radiografías de tórax en dos categorías: normal o pneumonia.
🛠️ El truco del Preprocesamiento
Aunque las radiografías tienen 1 solo canal (escala de grises) y un tamaño de 28×28 px, tuvimos que redimensionarlas a 224×224 y convertirlas a RGB. ¿Por qué? Porque los gigantes multimodales y los encoders visuales están preentrenados con imágenes a color. Si no les hablamos en su «idioma visual» (RGB), fallan.
El Gran Duelo Tecnológico
Prompting Multimodal (Zero-Shot)
Nvidia Nemotron 30BLe pasamos la imagen codificada en base64 y le dimos una orden estricta: «Eres un asistente médico. Devuelve solo un JSON válido con la etiqueta normal o pneumonia».
El Desastre Clínico 📉
El modelo colapsó y predijo absolutamente todo como «normal».
- Accuracy: 41.7% (Peor que tirar una moneda)
- F1 Macro: 0.294
- Falsos Negativos: 100% (No detectó ni una sola neumonía de las 7 presentes).
Veredicto: Rápido para hacer demos, pero peligroso y sesgado en entornos médicos sin ajuste fino.
Embeddings DINOv2 + Regresión Logística
ViT Small (timm)Usamos el Vision Transformer de Meta (DINOv2) configurado con num_classes=0 para amputarle la cabeza de clasificación. Lo usamos solo para extraer la «esencia» de la imagen en un vector matemático de 384 características. Sobre esos vectores, entrenamos una simple Regresión Logística.
La Solución Robusta 📈
El modelo entendió perfectamente los patrones de la enfermedad.
- Accuracy: 80.0% (Un salto abismal)
- F1 Macro: 0.766
- Detección de Neumonía: 71 casos correctos (solo 5 perdidos).
Veredicto: Sólido, estable y aprende fronteras complejas sin necesidad de reentrenar una red pesada desde cero.
Conclusión del Día 3
La magia del Zero-Shot Multimodal todavía no es suficiente para la precisión clínica pura en imágenes médicas específicas. El modelo tiende a sesgarse hacia la «normalidad» y genera Falsos Negativos críticos.
Sin embargo, la arquitectura híbrida gana por goleada: usar un modelo gigante (DINOv2) para traducir la imagen a números (Embeddings), y un algoritmo clásico (Regresión Logística) para clasificar esos números, nos da lo mejor de ambos mundos: comprensión visual profunda y control estadístico.