RiTeK:面向大语言模型对医学文本知识图谱进行复杂推理的数据集
计算与语言
2026-04-14 v3
摘要
在医学领域回答复杂现实问题往往需要从医学文本知识图谱(医学TKG)中准确检索信息,因为TKG中的关系路径信息可增强大语言模型(LLM)的推理能力。然而,主要瓶颈在于现有医学TKG稀缺、其拓扑结构表达有限,以及缺乏对当前检索器在医学TKG上进行全面评估。为此,我们首先开发了一个用于LLM对医学文本知识图谱进行复杂推理的数据集RiTeK,涵盖广泛的拓扑结构。具体而言,我们合成了真实用户查询,这些查询融合了多样化的拓扑结构、关系信息和复杂文本描述。我们进行严格的医学专家评估,以 Assess和验证所合成查询的质量。RiTeK也作为评估基于LLM的检索系统能力的全面基准数据集。通过在该基准上评估11个代表性检索器,我们发现现有方法在表现方面存在显著不足,揭示了当前LLM驱动检索方法在半结构化数据医学领域中的 notable 限制。这一发现凸显了针对医学领域更有效检索系统的迫切需求。
引用
@article{arxiv.2410.13987,
title = {RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in Medicine},
author = {Jiatan Huang and Mingchen Li and Zonghai Yao and Dawei Li and Yuxin Zhang and Zhichao Yang and Yongkang Xiao and Feiyun Ouyang and Xiaohan Li and Shuo Han and Hong Yu},
journal= {arXiv preprint arXiv:2410.13987},
year = {2026}
}
备注
ACL 2026 Findings