navigating 通过模型合并实现的帕累托最优前沿:跨越对齐-校准权衡
计算与语言
2025-11-03 v2 人工智能
机器学习
摘要
后训练的“对齐税”通常被表述为任务准确率的下降。我们指出,它还伴随着严重的校准损失,导致模型过度自信、可靠性降低以及输出多样性减少。我们展示,这一权衡可以通过一种简单的后处理干预来有效导航:在对齐前后插值模型的权重。关键在于,这并非严格的权衡。我们发现,该过程始终揭示出帕累托最优插值——即在显著恢复对齐期间失去的校准的同时,超越两个父模型的准确率的模型。我们的工作表明,简单的模型合并提供了一种计算上高效的方法,用于缓解整个对齐税的影响,生成更具能力和可靠性的模型。
引用
@article{arxiv.2510.17426,
title = {Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging},
author = {Tiancheng Hu and Benjamin Minixhofer and Nigel Collier},
journal= {arXiv preprint arXiv:2510.17426},
year = {2025}
}