中文

面向中文藏医学问答的可追溯跨源检索增强生成

人工智能 2026-02-11 v2

摘要

检索增强生成(RAG)承诺实现可靠的问答,但在存在多个异构知识库(KBs)的领域设置中仍面临挑战。在中文藏医学中,百科条目常稠密且易于匹配,这可能会主导检索,即使经典文献或临床论文提供更权威的证据。我们研究了包含三个知识库(百科、经典和临床论文)的实际场景,涵盖500个查询(截断K=5),覆盖单知识库和跨知识库问题。我们提出两种互补的方法以提高可追溯性,减少幻觉,并实现跨知识库验证。首先,DAKS执行知识库路由和预算分配检索,以缓解稠密性驱动的偏见,并在必要时优先选择权威来源。其次,我们使用对齐图指导证据融合和覆盖感知打包,提高跨知识库证据覆盖率,而无需依赖简单的拼接。所有答案都由轻量级生成器\textsc{openPangu-Embedded-7B}生成。实验显示,路由质量和跨知识库证据覆盖率均实现了一致的提升,完整系统在保持强大的忠实性和引用正确性的同时,实现了最佳的CrossEv@5。

关键词

引用

@article{arxiv.2602.05195,
  title  = {Traceable Cross-Source RAG for Chinese Tibetan Medicine Question Answering},
  author = {Fengxian Chen and Zhilong Tao and Jiaxuan Li and Yunlong Li and Qingguo Zhou},
  journal= {arXiv preprint arXiv:2602.05195},
  year   = {2026}
}