中文

解锁解码时可控性:基于对抗样本提示的梯度-free 多目标对齐

计算与语言 2024-08-12 v1

摘要

多目标对齐旨在平衡和控制大型语言模型的不同对齐目标(如有帮助性、无害性和诚实性),以满足不同用户的个性化需求。然而,先前方法倾向于训练多个模型来处理各种用户偏好,随着对齐目标和不同偏好数量的线性增长而增加。与此同时,现有方法在可扩展性方面通常很差,需要针对每个新考虑的对齐目标进行大量再训练。鉴于先前方法的局限性,我们提出了 MCA (Multi-objective Contrastive Alignment),为每个目标构建一个 expert 提示和一个对抗性提示,以在解码时进行对比并通过组合对比来平衡目标。我们的方法经过验证,在获得不同对齐目标良好分布的 Pareto 前沿方面优于先前方法。

关键词

引用

@article{arxiv.2408.05094,
  title  = {Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive Prompts},
  author = {Tingchen Fu and Yupeng Hou and Julian McAuley and Rui Yan},
  journal= {arXiv preprint arXiv:2408.05094},
  year   = {2024}
}