C²LEVA: 迈向全面且无污染的语言模型评估
计算与语言
2025-05-30 v3
摘要
大语言模型(LLM)的最新进展展现出显著潜力,但其评估引发了担忧,特别是由于无法获取专有训练数据而导致的数据污染问题。为解决这一问题,我们提出了 C²LEVA,一个全面的双语基准测试,具备系统性的污染防护机制。C²LEVA 首先提供涵盖 22 项任务的全面评估,每项任务针对 LLM 的特定应用或能力;其次,通过系统性的污染预防策略确保可信评估,该策略完全自动化测试数据更新并在基准测试数据发布时强制执行数据保护。我们对 15 个开源和专有模型的大规模评估验证了 C²LEVA 的有效性。
引用
@article{arxiv.2412.04947,
title = {C$^2$LEVA: Toward Comprehensive and Contamination-Free Language Model Evaluation},
author = {Yanyang Li and Tin Long Wong and Cheung To Hung and Jianqiao Zhao and Duo Zheng and Ka Wai Liu and Michael R. Lyu and Liwei Wang},
journal= {arXiv preprint arXiv:2412.04947},
year = {2025}
}
备注
Findings of ACL 2025; Project Page: https://github.com/LaVi-Lab/C2LEVA