从 RAG 到智能体:基于大语言模型智能体的伊斯兰医学回答验证
计算与语言
2025-06-24 v2
摘要
数百年来,像阿维森纳的《医学Canon》和先知《圣经医药》(Tibb-e-Nabawi)这样的伊斯兰医学文献,编码了丰富的预防保健、营养和整体疗法,然而这些资源仍不易于众多人获取,也在现代人工智能系统中被低估利用。现有的语言模型基准仅聚焦于事实记忆或用户偏好,导致在规模化验证文化嵌入医学指导方面存在空白。我们提出了一个统一的评估管道Tibbe-AG,将30个精心挑选的先知医学问题与人类验证的疗法对齐,并比较了三种大语言模型(LLaMA-3、Mistral-7B、Qwen2-7B)在三种配置下的表现:直接生成、检索增强生成和科学自批判过滤器。每个答案随后都由作为智能体评判的次级大语言模型进行评估,得到单个3C3H质量评分。检索通过提升13%的事实准确性,而智能体提示通过更深入的机制见解和安全性考量,再提升另外10%。我们的结果表明, 将经典伊斯兰文本与检索和自评估相结合,能够实现可靠且具有文化敏感性的医学问答。
引用
@article{arxiv.2506.15911,
title = {From RAG to Agentic: Validating Islamic-Medicine Responses with LLM Agents},
author = {Mohammad Amaan Sayeed and Mohammed Talha Alam and Raza Imam and Shahab Saquib Sohail and Amir Hussain},
journal= {arXiv preprint arXiv:2506.15911},
year = {2025}
}
备注
Published at the 4th Muslims in Machine Learning (MusIML) Workshop (ICML-25)