Tecnología

Publicado el 14 de febrero de 2025

Conjunto de dados

ChatGPT vs. médicos residentes

Uma referência com base em pontuações oficiais do conselho

Autor/a: Katz, U. et al. 2024

Fuente: NEJM AI - The AI Revolution in Medicine: Understanding How AI Can Advance Patient Care GPT versus Resident Physicians — A Benchmark Based on Official Board Scores

O avanço da inteligência artificial (IA) na medicina tem sido impulsionado pelo desenvolvimento de grandes modelos de linguagem (LLMs, na sigla em inglês para Large Language Models), como o ChatGPT, criado pela OpenAI. Essas tecnologias desempenham um papel inovador como solucionadores virtuais de problemas, capazes de gerar textos com fluidez humana e demonstrar habilidades complexas de tomada de decisão. A integração dos LLMs como ferramentas de apoio na prática clínica apresenta um potencial promissor. No entanto, para que essa transição ocorra de forma segura e eficaz, é essencial comparar o desempenho desses modelos com o de médicos treinados.

Nesse contexto, um estudo conduzido por Katz e colaboradores (2024) avaliou o desempenho do GPT-3.5 e do GPT-4 em exames oficiais de conselhos médicos, comparando seus resultados com os de 849 médicos praticantes em cinco especialidades médicas. Para a análise, os pesquisadores utilizaram os exames de residência do conselho israelense de 2022, obtendo as pontuações oficiais dos médicos por meio da Associação Médica Israelense. O desempenho dos LLMs foi então calculado em percentis comparativos com os médicos de cada especialidade.

Resultados

Os achados revelaram que o GPT-4 superou a maioria dos médicos em psiquiatria, atingindo um percentil mediano de 74,7% (IC 95%: 66,2 – 81,0). Além disso, apresentou desempenho semelhante ao profissional mediano em cirurgia geral e clínica médica, com percentis medianos de 44,4% (IC 95%: 38,9 – 55,5) e 56,6% (IC 95%: 44,0 – 65,7), respectivamente.

Apesar de um desempenho inferior em pediatria e obstetrícia/ginecologia, o GPT-4 ainda obteve pontuação superior a uma parcela significativa dos médicos avaliados. Em contrapartida, o GPT-3.5 não atingiu a pontuação mínima para aprovação em nenhuma das especialidades e obteve desempenho inferior à maioria dos médicos. No geral, o GPT-4 foi aprovado no exame de residência em quatro das cinco especialidades, atingindo uma pontuação mediana superior à nota de corte de 65%.

Perspectivas para a Medicina

A evolução do GPT-3.5 para o GPT-4 marca um ponto crucial no desenvolvimento da IA aplicada à saúde, evidenciando que os modelos de linguagem estão alcançando níveis de desempenho comparáveis aos médicos. Esses avanços representam uma oportunidade para reconfigurar o treinamento e o suporte à prática médica, abrindo caminho para uma nova era em que IA e medicina trabalham em conjunto para aprimorar diagnósticos, tratamentos e a eficiência dos profissionais de saúde.