中文

navigating 通过模型合并实现的帕累托最优前沿:跨越对齐-校准权衡

计算与语言 2025-11-03 v2 人工智能 机器学习

摘要

后训练的“对齐税”通常被表述为任务准确率的下降。我们指出,它还伴随着严重的校准损失,导致模型过度自信、可靠性降低以及输出多样性减少。我们展示,这一权衡可以通过一种简单的后处理干预来有效导航:在对齐前后插值模型的权重。关键在于,这并非严格的权衡。我们发现,该过程始终揭示出帕累托最优插值——即在显著恢复对齐期间失去的校准的同时,超越两个父模型的准确率的模型。我们的工作表明,简单的模型合并提供了一种计算上高效的方法,用于缓解整个对齐税的影响,生成更具能力和可靠性的模型。

关键词

引用

@article{arxiv.2510.17426,
  title  = {Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging},
  author = {Tiancheng Hu and Benjamin Minixhofer and Nigel Collier},
  journal= {arXiv preprint arXiv:2510.17426},
  year   = {2025}
}