中文

COMPKE:知识编辑下的复杂问答

计算与语言 2025-06-04 v2 人工智能 机器学习

摘要

知识编辑能够高效修改大语言模型中的知识,已引起广泛关注。当前的基准主要使用多跳问答来评估和分析新注入或更新的知识。然而,我们认为这些基准未能有效评估更新后的模型在现实场景中应用这些知识的能力,特别是当问题需要复杂推理、涉及一对多关系或多步逻辑交集时。为了填补这一空白,我们引入了一个新基准:COMPKE:知识编辑下的复杂问答,其中包含 11,924 个反映现实生活场景的复杂问题。我们在 COMPKE 上对四种知识编辑方法进行了广泛评估,结果显示它们在不同模型上的有效性存在显著差异。例如,MeLLo 在 GPT-4O-MINI 上达到了 39.47 的准确率,但在 QWEN2.5-3B 上骤降至 3.83。我们进一步从方法论和模型特定视角调查了这些差异的根本原因。数据集可在 https://github.com/kzjkzj666/CompKE 获取。

关键词

引用

@article{arxiv.2506.00829,
  title  = {COMPKE: Complex Question Answering under Knowledge Editing},
  author = {Keyuan Cheng and Zijian Kan and Zhixian He and Zhuoran Zhang and Muhammad Asif Ali and Ke Xu and Lijie Hu and Di Wang},
  journal= {arXiv preprint arXiv:2506.00829},
  year   = {2025}
}

备注

Accepted by ACL 2025 Findings