中文

LatestEval:通过动态与时间敏感测试构建解决语言模型评估中的数据污染问题

计算与语言 2024-03-04 v3 人工智能

摘要

随着在超大规模、自动抓取的语料库上预训练的语言模型的出现,评估中的数据污染问题日益普遍。该问题对准确评估模型能力及其泛化性构成了重大挑战。在本文中,我们提出了 LatestEval,这是一种利用最新文本创建无污染阅读理解评估的自动化方法。LatestEval 仅使用在最近时间窗口内发布的文本,确保与预训练语言模型的训练语料库无重叠,从而避免数据污染。我们开发了 LatestEval 自动化流水线,以 1) 收集最新文本;2) 识别关键信息;3) 针对该信息构建问题,同时从上下文中移除已有答案。这促使模型基于剩余上下文自行推断答案,而非仅仅复制粘贴。我们的实验表明,与先前的基准相比,语言模型在 LatestEval 上表现出可忽略的机械记忆行为,表明数据污染风险显著降低,从而带来更稳健的评估。数据和代码公开于:https://github.com/liyucheng09/LatestEval。

关键词

引用

@article{arxiv.2312.12343,
  title  = {LatestEval: Addressing Data Contamination in Language Model Evaluation through Dynamic and Time-Sensitive Test Construction},
  author = {Yucheng Li and Frank Guerin and Chenghua Lin},
  journal= {arXiv preprint arXiv:2312.12343},
  year   = {2024}
}

备注

AAAI 2024