PITA:面向 LLM 后训练的偏好引导推理时对齐
人工智能
2025-11-14 v2 计算与语言
机器学习
摘要
推理时对齐使大型语言模型(LLM)能够生成符合终端用户偏好的输出,无需进一步训练。最近的后训练方法通过使用小型指导模型在推理时修改标记生成来实现这一目标,这些方法通常以 KL 正则化的原始 LLM 作为参考策略来优化奖励函数。然而,这些方法的一个关键局限是它们依赖预训练奖励模型,该模型需要适配人类偏好反馈——这可能是一个不稳定的过程。相反,我们引入 PITA(Preference-Guided Inference-Time Alignment),一种新型框架,将偏好反馈直接集成到 LLM 的标记生成中,无需奖励模型。PITA 通过学习小型基于偏好的指导策略,在推理时修改标记概率,无需 LLM 微调,降低计算成本,绕开预训练奖励模型的依赖。该问题被表述为识别底层偏好分布,通过随机搜索和迭代细化基于偏好的指导模型来实现。我们在包括数学推理和情感分类等多种任务上评估了 PITA,证明其在符合用户偏好方面具有有效性。
引用
@article{arxiv.2507.20067,
title = {PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training},
author = {Sarat Chandra Bobbili and Ujwal Dinesha and Dheeraj Narasimha and Srinivas Shakkottai},
journal= {arXiv preprint arXiv:2507.20067},
year = {2025}
}