双目标语言模型:训练效率与过拟合的平衡
计算与语言
2026-03-30 v3 人工智能
摘要
本文通过无需任何架构修改地组合作回归和掩码扩散训练目标,构建出灵活的语言模型,显著优于单一目标模型。作回归建模是流行的方法,部分原因是其训练效率高;然而,这以易过拟合为代价。相比之下,掩码扩散模型训练效率较低,但对过拟合更不敏感。本文证明,双目标训练实现了两者的极佳结合。为确定两种目标的最佳平衡比例,我们在不同数据重复水平下训练和评估了50个语言模型。结果表明,在所有评估设置下,组合两种目标都是最优的,且针对作回归或掩码扩散下游任务的 optimal balance 相似。
引用
@article{arxiv.2512.14549,
title = {Dual-objective Language Models: Training Efficiency Without Overfitting},
author = {David Samuel and Lucas Georges Gabriel Charpentier},
journal= {arXiv preprint arXiv:2512.14549},
year = {2026}
}