偏好驱动的大语言模型对齐:基于表示编辑的 Pref-CTRL 方法
计算与语言
2026-04-28 v1 人工智能
摘要
测试时对齐方法作为一种通过在推理时对大语言模型(LLM)的内部表示进行轻量级干预来引导其输出的替代方案,正在成为具有前景的选择。最近,一种突出且有效的方法 RE-Control(Kong 等人,2024)提出了利用在 LLM 隐藏状态上训练的外部价值函数,通过梯度基于编辑来指导生成。虽然该方法有效,但忽略了对齐任务的一个关键特征,即这些任务通常被建模为从人类偏好中学习候选响应之间的偏好。为此,本文提出了一种新颖的偏好驱动训练框架 Pref-CTRL,该框架使用多目标价值函数更好地反映偏好数据结构的特征。我们的方法在两个基准数据集上超越了 RE-Control,并在跨域数据集上表现出更好的泛化能力。我们的源代码已公开于 https://github.com/UTS-nlPUG/pref-ctrl。
引用
@article{arxiv.2604.23543,
title = {Pref-CTRL: Preference Driven LLM Alignment using Representation Editing},
author = {Imranul Ashrafi and Inigo Jauregi Unanue and Massimo Piccardi},
journal= {arXiv preprint arXiv:2604.23543},
year = {2026}
}
备注
Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)