中文

PertEval:通过知识不变扰动揭示大语言模型的真实知识能力

计算与语言 2024-10-21 v2 人工智能 计算机与社会

摘要

专家设计的闭端基准测试在评估大语言模型(LLM)的知识能力中不可或缺。尽管它们被广泛使用,但由于测试场景有限以及不可避免的数据污染风险,其可靠性受到质疑。为解决这一问题,我们提出了PertEval,一个通过**知识不变扰动**深入探测LLM知识能力的工具包。这些扰动采用类人重述技术,从静态基准中动态生成测试样本,精心保留知识关键内容的同时改变无关细节。我们的工具包还包括一套**响应一致性分析**,比较原始测试集与扰动测试集上的性能,以精确评估LLM的真实知识能力。使用PertEval重新评估了六个代表性LLM。结果显示,LLM在原始基准上的性能被显著高估,包括GPT-4被高估了25.8%(绝对值)。此外,通过细致的响应模式分析,我们发现PertEval保留了LLM对似是而非知识的不确定性,并揭示了它们对正确选项的潜在死记硬背,从而导致性能被高估。我们还发现,PertEval的详细响应一致性分析能够揭示现有LLM知识掌握中的各种弱点,并指导改进方向。我们的发现为推进更鲁棒且真正有知识的LLM提供了见解。我们的代码可在 \url{https://github.com/aigc-apps/PertEval} 获取。

关键词

引用

@article{arxiv.2405.19740,
  title  = {PertEval: Unveiling Real Knowledge Capacity of LLMs with Knowledge-Invariant Perturbations},
  author = {Jiatong Li and Renjun Hu and Kunzhe Huang and Yan Zhuang and Qi Liu and Mengxiao Zhu and Xing Shi and Wei Lin},
  journal= {arXiv preprint arXiv:2405.19740},
  year   = {2024}
}

备注

Accepted by NeurIPS '24 D&B Spotlight; 28 pages, 15 figures, 14 tables