中文

LastingBench:防御基准数据泄露

计算与语言 2025-09-16 v2 人工智能

摘要

大型语言模型(LLM)的日益复杂引发了关于其在标准问答(QA)基准测试中“作弊”——通过记忆特定任务数据——的担忧。这削弱了基准评估的有效性,因为它们不再反映模型的真实能力,而是数据泄露的效应。虽然先前工作聚焦检测此类泄露,但鲜有关注如何减轻其影响并保持基准的长期实用性。本文引入LastingBench,一种新框架,持续加固既有基准测试以防止数据泄露。LastingBench通过扰动识别上下文中的漏洞点,然后将其重写为反事实情境——破坏记忆效应,同时保持基准原本的评估意图。对先进QA基准测试的评估显示出显著性能差距,凸显了LastingBench在减少记忆效应方面的有效性。LastingBench为确保基准长期稳健提供了实用且可扩展的解决方案,推动LLM评估更公平、更可解释。

关键词

引用

@article{arxiv.2506.21614,
  title  = {LastingBench: Defend Benchmarks Against Knowledge Leakage},
  author = {Yixiong Fang and Tianran Sun and Yuling Shi and Min Wang and Xiaodong Gu},
  journal= {arXiv preprint arXiv:2506.21614},
  year   = {2025}
}