El experimento consiste en correr dos modelos de 4B en una máquina común, extrayendo signos vitales de un corpus de notas médicas con respuestas conocidas. Se evalúan cuatro aspectos por separado: si encuentra el dato, si el valor es correcto, si la unidad es correcta, y si la frase citada existe realmente en la nota.
1. La detección casi no falla. Ambos modelos encontraron prácticamente todos los datos. Si se midiera solo eso, los dos parecerían equivalentes. No lo son.
2. Los dos modelos fallaron la misma nota, pero en direcciones opuestas. Se trataba de una planilla con etiquetas y valores en columnas distintas.
Un modelo acertó todos los valores, pero inventó todas las citas: los números eran correctos, pero atribuidos a frases que nadie escribió.
El otro citó la nota con fidelidad perfecta, pero leyó la fila equivocada: cita real, valor ajeno. Un puntaje global los habría empatado y habría descrito mal a ambos.
3. Un modelo obtuvo puntaje cero, y el motivo no tenía nada que ver con medicina.
Un fallo de formato y un fallo de comprensión se ven idénticos desde afuera, y llevan a perder días en el problema equivocado.