中文

KIEval:一种面向大语言模型的知识 grounding 交互式评估框架

计算与语言 2024-06-04 v2 人工智能 机器学习

摘要

大语言模型(LLMs)的自动评估方法受到数据污染的阻碍,导致对其有效性的评估被夸大。现有的策略旨在检测受污染的文本,侧重于量化污染状态,而非准确衡量模型性能。在本文中,我们介绍了 KIEval,这是一种知识 grounding 交互式评估框架,首次引入了由 LLM 驱动的“交互者”角色,以实现动态的抗污染评估。KIEval 从涉及领域特定知识的传统 LLM 基准问题开始,利用动态生成的、多轮的、以知识为中心的对话,来判断模型的回应仅仅是基准答案的回忆,还是展示了在更复杂对话中应用知识的深刻理解。在五个数据集上对七个领先 LLM 进行的广泛实验验证了 KIEval 的有效性和泛化能力。我们还揭示,数据污染对模型的实际应用和理解没有贡献甚至产生负面影响,且现有的 LLM 污染检测方法只能识别预训练阶段的污染,而无法识别监督微调期间的污染。

关键词

引用

@article{arxiv.2402.15043,
  title  = {KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models},
  author = {Zhuohao Yu and Chang Gao and Wenjin Yao and Yidong Wang and Wei Ye and Jindong Wang and Xing Xie and Yue Zhang and Shikun Zhang},
  journal= {arXiv preprint arXiv:2402.15043},
  year   = {2024}
}

备注

Accepted to ACL 2024 (main conference); 19 pages, 5 figures, 19 tables, code is available at: https://github.com/zhuohaoyu/KIEval