中文

语言模型的灵活重新对齐

计算与语言 2026-01-13 v2 人工智能

摘要

当语言模型(LM)未能达到预期性能时,需要进行重新对齐。本文提出了一种灵活的重新对齐框架,支持在训练和推理过程中对对齐程度进行定量控制。该框架包含训练时重新对齐(TrRa),通过利用参考模型与已对齐模型的逻辑值的可控融合,高效地对参考模型进行重新对齐。例如,TrRa在DeepSeek-R1-Distill-Qwen-1.5B上将token使用量减少了54.63%,且没有任何性能退化,优于DeepScaleR-1.5B的33.86%。为补充TrRa在推理阶段的应用,本文引入了一种层适配器,可实现平滑的推理时重新对齐(InRa)。该适配器在底层初始化为恒等变换,并插入在原始层之前。在推理过程中,输入嵌入同时由适配器和原始层处理,随后经过剩余层,然后在逻辑值层面进行可控插值。我们将DeepSeek-R1-Distill-Qwen-7B从慢思考模型升级为同时支持快思考和慢思考的模型,允许在推理过程中灵活控制对齐程度。通过鼓励更深层的推理,该模型甚至超越了其原始性能。

关键词

引用

@article{arxiv.2506.12704,
  title  = {Flexible Realignment of Language Models},
  author = {Wenhong Zhu and Ruobing Xie and Weinan Zhang and Rui Wang},
  journal= {arXiv preprint arXiv:2506.12704},
  year   = {2026}
}