中文

OpenTCM:基于GraphRAG赋能的大语言模型中文医学知识检索与诊断系统

信息检索 2025-06-30 v4 人工智能

摘要

中华医学(TCM)代表着丰富的古代医学知识,持续在现代医疗中发挥重要作用。由于TCM文献的复杂性和广度,AI技术的集成对于其现代化和更广泛的可达性至关重要。然而,这一集成面临诸多挑战,包括对晦涩古文文本的解读以及对TCM概念之间复杂语义关系的建模。本文开发了OpenTCM,一个集成特定于TCM知识图谱和基于图的检索增强生成(GraphRAG)的大语言模型系统。首先,我们在中文医学经典数据库中收集68部妇科书籍的超过373万个中文字符,由TCM和妇科专家帮助完成。其次,我们利用定制提示和面向中文的大语言模型(如DeepSeek和Kimi)构建了包含48,000多个实体和152,000个关联关系的综合多关系知识图谱,确保语义理解的高保真度。最后,我们赋能OpenTCM采用GraphRAG,实现无需模型微调即可进行高保真的药物成分知识检索和诊断问答。实验评估表明,OpenTCM在药物信息检索任务中实现4.378的平均专家分数(MES),在诊断问答任务中实现4.045,净超越了实际应用场景中的最先进解决方案。

关键词

引用

@article{arxiv.2504.20118,
  title  = {OpenTCM: A GraphRAG-Empowered LLM-based System for Traditional Chinese Medicine Knowledge Retrieval and Diagnosis},
  author = {Jinglin He and Yunqi Guo and Lai Kwan Lam and Waikei Leung and Lixing He and Yuanan Jiang and Chi Chiu Wang and Guoliang Xing and Hongkai Chen},
  journal= {arXiv preprint arXiv:2504.20118},
  year   = {2025}
}

备注

8 pages, 5 figures, 7 tables