DIA 3 PROYECTO

Proyecto IA-RX | Día 3

LLMs Multimodales vs. DINOv2

El choque de los titanes fundacionales en la clasificación de radiografías médicas.

El Nuevo Reto: PneumoniaMNIST

Dejamos temporalmente nuestro panel oscuro para validar estrategias con un clásico médico: PneumoniaMNIST. El objetivo es clasificar radiografías de tórax en dos categorías: normal o pneumonia.

🛠️ El truco del Preprocesamiento

Aunque las radiografías tienen 1 solo canal (escala de grises) y un tamaño de 28×28 px, tuvimos que redimensionarlas a 224×224 y convertirlas a RGB. ¿Por qué? Porque los gigantes multimodales y los encoders visuales están preentrenados con imágenes a color. Si no les hablamos en su «idioma visual» (RGB), fallan.

El Gran Duelo Tecnológico

Round 1

Prompting Multimodal (Zero-Shot)

Nvidia Nemotron 30B

Le pasamos la imagen codificada en base64 y le dimos una orden estricta: «Eres un asistente médico. Devuelve solo un JSON válido con la etiqueta normal o pneumonia».

El Desastre Clínico 📉

El modelo colapsó y predijo absolutamente todo como «normal».

  • Accuracy: 41.7% (Peor que tirar una moneda)
  • F1 Macro: 0.294
  • Falsos Negativos: 100% (No detectó ni una sola neumonía de las 7 presentes).

Veredicto: Rápido para hacer demos, pero peligroso y sesgado en entornos médicos sin ajuste fino.

VS
Round 2

Embeddings DINOv2 + Regresión Logística

ViT Small (timm)

Usamos el Vision Transformer de Meta (DINOv2) configurado con num_classes=0 para amputarle la cabeza de clasificación. Lo usamos solo para extraer la «esencia» de la imagen en un vector matemático de 384 características. Sobre esos vectores, entrenamos una simple Regresión Logística.

La Solución Robusta 📈

El modelo entendió perfectamente los patrones de la enfermedad.

  • Accuracy: 80.0% (Un salto abismal)
  • F1 Macro: 0.766
  • Detección de Neumonía: 71 casos correctos (solo 5 perdidos).

Veredicto: Sólido, estable y aprende fronteras complejas sin necesidad de reentrenar una red pesada desde cero.

💡

Conclusión del Día 3

La magia del Zero-Shot Multimodal todavía no es suficiente para la precisión clínica pura en imágenes médicas específicas. El modelo tiende a sesgarse hacia la «normalidad» y genera Falsos Negativos críticos.

Sin embargo, la arquitectura híbrida gana por goleada: usar un modelo gigante (DINOv2) para traducir la imagen a números (Embeddings), y un algoritmo clásico (Regresión Logística) para clasificar esos números, nos da lo mejor de ambos mundos: comprensión visual profunda y control estadístico.

¿Aplicaremos DINOv2 a nuestro panel de la caja de luz?

Ya tenemos la tecnología ganadora. En el próximo capítulo, volveremos a nuestro problema original del posicionamiento de la mano aplicando estos nuevos superpoderes.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *