SuperValid:面向可泛化下游扩展的能力对齐 OOD 验证
计算与语言
2026-05-28 v1
摘要
规模定律通过计算与交叉熵损失的关系来指导大型语言模型的训练,近期研究进一步扩展到预测下游基准性能。然而,现有方法面临两个方面的泛化限制:关注基准级别性能引入场景特定制剂,依赖 IID 验证损失无法在训练分布变化时跟踪能力提升。在本工作中,我们认为下游扩展应在能力层面上进行,这能够捕捉跨相关任务的共享技能因素,同时抽象掉基准特定的噪声。我们提出了 SuperValid 框架,通过从能力领域内的基准中提炼核心概念并扩展为多样化、富有知识的文本,合成 OOD(out-of-distribution)、能力对齐的验证数据。广泛的实验覆盖 17 个基准,分为 6 个能力领域,显示 SuperValid 损失在不同架构、规模和训练数据分布的模型之间表现出强大且稳定的相关性。作为一种在训练期间可计算且无需基准评估的训练-free 指标,SuperValid 实现了有效的模型选择、提前停止和规模决策。
引用
@article{arxiv.2605.28179,
title = {SuperValid: Capability-Aligned OOD Validation for Generalizable Downstream Scaling},
author = {Quanen Sun and Changxin Tian and Ke Shi and Cai Chen and Cunyin Peng and Jia Liu and Kunlong Chen and Zhiqiang Zhang},
journal= {arXiv preprint arXiv:2605.28179},
year = {2026}
}