Recherche publiée : benchmark, sans impact clinique démontré
Arkangel AI: A conversational agent for real-time, evidence-based medical question-answeringAuteurs enregistrés pour l’article: Maria Camila Villa; Natalia Castano-Villegas; Isabella Llano; Julian Martinez; Maria Fernanda Guevara; Jose Zea; Laura Velásquez.
L’article complet décrit cinq LLM et des workflows prédéfinis de récupération et réponse, évalués avec MedQA et PubMedQA. La précision utilise les 1 273 questions de test MedQA sans fine-tuning. L’évaluation de récupération et qualité utilise 127 questions MedQA (10 %) et 500 questions Human-Evaluated PubMedQA (50 %), avec métriques RAGAS de contexte, pertinence et fidélité, tests statistiques et intervalles de confiance à 95 %.
- 90,26 % de précision sur MedQA (1 273 questions).
- 80 % de récupération des articles attendus.
- 82 % de réponses pertinentes sur PubMedQA.
- Tableau 8 : 401/500 résumés attendus récupérés (80,20 %).
- Tableau 9 : 414/500 réponses pertinentes (82,80 %).
Ces benchmarks évaluent le système étudié, pas les résultats des patients, la précision diagnostique en pratique ni une garantie du service actuel. Une validation externe et des scénarios réels avec des médecins restent nécessaires. Les spécialités sont inégalement représentées dans MedQA. Le tableau 9 de PubMedQA mentionne également 86 réponses non pertinentes et 23 vides avec 414 pertinentes ; les catégories doivent être clarifiées avant d’interpréter les exclusions. Les auteurs déclarent des liens avec Arkangel AI ; ce n’est pas une validation indépendante.
Référence consultée le 8 octobre 2026 : métadonnées du DOI et PDF éditorial complet de 12 pages lié publiquement par Arkangel AI. Le résumé arrondit récupération et pertinence à 80 % et 82 % ; les tableaux 8 et 9 indiquent 80,20 % et 82,80 %.
Résumé publié indexéArticle éditorial complet (PDF)