中文

AdEval:基于对齐的动态评估以缓解大语言模型中的数据污染问题

计算与语言 2025-08-13 v5 人工智能

摘要

随着大语言模型(LLM)在超大规模语料库上预训练,数据污染问题日益严重,静态评估基准可能高估LLM的性能。为此,本文提出一种称为AdEval(基于对齐的动态评估)的动态数据评估方法。AdEval首先从静态数据集中提取知识点和核心思想,以实现与静态基准核心内容的动态对齐,通过避免直接依赖静态数据集,本方法本身降低了来自数据源的污染风险。随后,通过在线搜索获取背景信息,以生成知识点的详细描述。最后,基于布卢姆斯坦认知层级设计问题,覆盖六个维度:记忆、理解、应用、分析、评估和创造,以实现多层次认知评估。此外,AdEval通过迭代问题重构控制动态生成数据的复杂度。多个数据集上的实验结果表明,AdEval有效缓解了数据污染对评估结果的影响,解决了复杂度控制不足和单维度评估的问题,提升了LLM评估的公平性、可靠性和多样性。

关键词

引用

@article{arxiv.2501.13983,
  title  = {AdEval: Alignment-based Dynamic Evaluation to Mitigate Data Contamination in Large Language Models},
  author = {Yang Fan},
  journal= {arXiv preprint arXiv:2501.13983},
  year   = {2025}
}

备注

There are serious academic problems in this paper, such as data falsification and plagiarism in the method of the paper