Hice fine-tuning de un modelo ultrapequeño de 1.7B de parámetros para que extraiga signos vitales de texto de forma precisa.
Esto me permitió sustituir un modelo de 4B, bastante más pesado para el hardware.
El modelo de 4B requiere 4.3 GB de RAM y es mucho más lento (10 tokens por segundo vs. 24 tokens por segundo)
Todo esto corriendo en una laptop común: Ryzen 5 y 32 GB de RAM (el fine tuning lo hice con un servicio de GPU y arquitectura en la nube).
Lo interesante es que para tareas clínicas muy específicas, no siempre hace falta un modelo enorme.
Un modelo pequeño, bien ajustado, puede ser suficiente y además ofrecer menor latencia, menor consumo de recursos y la posibilidad de procesar datos localmente.
En medicina, esto último puede ser especialmente relevante por privacidad, costos y despliegue en entornos con infraestructura limitada.
En mi opinión, los modelos locales en medicina van a explotar muy pronto.