中文

面向知识图谱的多层级问答抽取框架 KG-MuLQA 与长上下文 LLM 评估

计算与语言 2026-01-13 v2

摘要

我们提出 KG-MuLQA(Knowledge-Graph-based Multi-Level Question-Answer Extraction,基于知识图谱的多层级问答抽取):一个框架 (1) 通过利用知识图谱基于文档的表征,从多个复杂度层次抽取 QA 对 (2) 沿三个关键维度 -- 多跳检索、集合运算和答案多样性 -- 实现。该方法 enables 对模型在受控难度层次上的性能进行细粒度评估。借助该框架,我们构建了基于金融信用协议的 20,139 对 QA 数据集,并评估了 16 个专有和开源大语言模型,发现即便是表现最好的模型在处理基于集合的比较和长上下文中的多跳推理时仍显著困难。我们的分析揭示了与语义误解释及无法处理隐式关系相关的系统性失效模式。

关键词

引用

@article{arxiv.2505.12495,
  title  = {KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM Evaluation},
  author = {Nikita Tatarinov and Vidhyakshaya Kannan and Haricharana Srinivasa and Arnav Raj and Harpreet Singh Anand and Varun Singh and Aditya Luthra and Ravij Lade and Agam Shah and Sudheer Chava},
  journal= {arXiv preprint arXiv:2505.12495},
  year   = {2026}
}