Dentista Live › Últimas notícias
«IA como juiz» não serve para avaliar recomendações odontológicas, conclui estudo
Seis modelos de linguagem avaliaram respostas a nove perguntas da FDI; a concordância entre avaliadores de IA e clínicos humanos foi extremamente baixa e as omissões clínicas passaram despercebidas.

Um estudo publicado no International Dental Journal testou se modelos de linguagem servem para avaliar a qualidade de recomendações odontológicas. A resposta foi não.
O desenho foi o seguinte: seis profissionais de saúde bucal responderam nove perguntas sobre temas da Federação Dentária Internacional — bebês, gravidez, xerostomia em idosos, prevenção e traumatismo dentário. Depois, dois dentistas clínicos e três profissionais atuando como avaliadores humanos, mais seis modelos de IA no papel de «juízes», pontuaram essas respostas. Os modelos testados foram DeepSeek-V3, Doubao-1.8-Pro, GPT-5, Gemini 3, Qwen3-Max e Kimi K2.
DeepSeek-V3 e Doubao-1.8-Pro tiveram o melhor desempenho geral. Mas o achado central está na concordância: alta entre os clínicos humanos, muito baixa entre os avaliadores de IA, e extremamente baixa entre a IA e os humanos. Os modelos pontuaram com mais rigor, e ainda assim não identificaram omissões clinicamente importantes.
A conclusão dos autores é direta: estruturas de «IA como juiz» não são substitutos confiáveis para a avaliação humana especializada.
Por que importa: é relevante para quem pensa em usar IA para revisar protocolos, material de orientação ao paciente ou prova de residência. A ferramenta classifica, mas não vê o que falta.
O que conferir: o artigo no International Dental Journal, de agosto de 2026.