Pesquisa publicada: benchmark, não impacto clínico demonstrado
Arkangel AI: A conversational agent for real-time, evidence-based medical question-answeringAutores registrados para o artigo: Maria Camila Villa; Natalia Castano-Villegas; Isabella Llano; Julian Martinez; Maria Fernanda Guevara; Jose Zea; Laura Velásquez.
O artigo completo descreve cinco LLMs e fluxos predefinidos de recuperação e resposta, avaliados com MedQA e PubMedQA. A precisão usa as 1.273 perguntas de teste do MedQA sem fine-tuning. A avaliação de recuperação e qualidade usa 127 perguntas MedQA (10%) e 500 perguntas Human-Evaluated PubMedQA (50%), com métricas RAGAS de contexto, relevância e fidelidade, testes estatísticos e intervalos de confiança de 95%.
- 90,26% de precisão no MedQA (1.273 perguntas).
- 80% de recuperação dos artigos esperados.
- 82% de respostas relevantes no PubMedQA.
- Tabela 8: 401/500 resumos esperados recuperados (80,20%).
- Tabela 9: 414/500 respostas relevantes (82,80%).
Esses benchmarks avaliam o sistema estudado, não desfechos de pacientes, precisão diagnóstica na prática ou garantia do serviço atual. São necessárias validação externa e situações reais com médicos. As especialidades são representadas de forma desigual no MedQA. A tabela 9 do PubMedQA também lista 86 respostas não relevantes e 23 vazias junto de 414 relevantes; as categorias precisam ser esclarecidas antes de interpretar exclusões. Os autores declaram vínculos com a Arkangel AI; não é validação independente.
Referência consultada em 8 de outubro de 2026: metadados do DOI e PDF editorial completo de 12 páginas vinculado publicamente pela Arkangel AI. O resumo arredonda recuperação e relevância para 80% e 82%; as tabelas 8 e 9 relatam 80,20% e 82,80%.
Resumo publicado indexadoArtigo editorial completo (PDF)