Investigación publicada: benchmark, no impacto clínico demostrado
Arkangel AI: A conversational agent for real-time, evidence-based medical question-answeringAutores registrados para el artículo: Maria Camila Villa; Natalia Castano-Villegas; Isabella Llano; Julian Martinez; Maria Fernanda Guevara; Jose Zea; Laura Velásquez.
El artículo completo describe cinco LLMs y flujos predefinidos de recuperación y respuesta, evaluados con MedQA y PubMedQA. La precisión usa las 1.273 preguntas de test de MedQA sin fine-tuning. La evaluación de recuperación y calidad usa 127 preguntas MedQA (10%) y 500 preguntas Human-Evaluated PubMedQA (50%), con métricas RAGAS de contexto, relevancia y fidelidad, pruebas estadísticas e intervalos de confianza del 95%.
- 90,26% de precisión en MedQA (1.273 preguntas).
- 80% de recuperación de artículos esperados.
- 82% de respuestas relevantes en PubMedQA.
- Tabla 8: 401/500 resúmenes esperados recuperados (80,20%).
- Tabla 9: 414/500 respuestas relevantes (82,80%).
Estos benchmarks evalúan el sistema estudiado, no desenlaces de pacientes, precisión diagnóstica en la práctica ni garantía del servicio actual. Se requieren validación externa y escenarios reales con médicos. Las especialidades están representadas de forma desigual en MedQA. La tabla 9 de PubMedQA imprime además 86 respuestas no relevantes y 23 vacías junto a 414 relevantes; deben aclararse las categorías antes de interpretar exclusiones. Los autores declaran vínculos con Arkangel AI; no es validación independiente.
Referencia consultada el 8 de octubre de 2026: metadata del DOI y PDF editorial completo de 12 páginas enlazado públicamente por Arkangel AI. El resumen redondea recuperación y relevancia a 80% y 82%; las tablas 8 y 9 reportan 80,20% y 82,80%.
Resumen publicado indexadoArtículo editorial completo (PDF)