基准阴影:大语言模型中的数据对齐、参数足迹与泛化
机器学习
2026-04-10 v1
摘要
大语言模型通常在没有对应更广泛能力提升的情况下取得强劲的基准增益。我们假设这种差异源于由数据分布差异所导致的训练范式差异。为了研究这一问题,我们设计了受控的数据干预,在固定训练设置下隔离分布效应。我们发现,与基准对齐的数据改善了窄评估指标,同时限制了更广泛的表征发展,而覆盖扩展的数据则导致更分布的参数适应和更好的泛化。我们进一步引入了基于谱分析和秩分析的参数空间诊断,揭示了这些范式的不同结构特征。在各种开源模型族中观察到类似的模式,包括多模态模型作为关键案例研究,表明这些效应超越了受控设置。关于提示重复的案例研究表明,并非所有数据伪影都会引发范式转变。这些结果表明,仅凭基准性能不足以表征模型能力,并强调了数据分布在塑造学习动态中的重要性。
引用
@article{arxiv.2604.07363,
title = {Benchmark Shadows: Data Alignment, Parameter Footprints, and Generalization in Large Language Models},
author = {Hongjian Zou and Yidan Wang and Qi Ding and Yixuan Liao and Xiaoxin Chen},
journal= {arXiv preprint arXiv:2604.07363},
year = {2026}
}
备注
28 pages, 26 figures, 8 tables