中文

语言模型的可控解码

机器学习 2024-06-05 v3 人工智能 计算与语言

摘要

KL 正则化强化学习(RL)是一种流行的对齐框架,用于将语言模型响应控制朝向高奖励结果。我们提出一个逐 token 的 RL 目标并为其给出模块化求解器,称为可控解码(CD)。CD 通过一个独立的前缀打分器模块施加控制,该模块被训练以学习奖励的价值函数。前缀打分器在推理时用于从冻结基模型控制生成,可证明地从 RL 目标的解中采样。我们凭经验证明 CD 在流行基准上作为控制机制是有效的。我们还展示多个奖励的前缀打分器可在推理时组合,有效求解多目标 RL 问题而无需额外训练。我们表明应用 CD 的益处可迁移至未见的基模型而无需进一步调优。最后,我们展示 CD 可在推理时以块级解码方式应用,本质上弥合了流行的 best-of-K 策略与通过强化学习的逐 token 控制之间的差距。这使 CD 成为一种有前景的语言模型对齐方法。

关键词

引用

@article{arxiv.2310.17022,
  title  = {Controlled Decoding from Language Models},
  author = {Sidharth Mudgal and Jong Lee and Harish Ganapathy and YaGuang Li and Tao Wang and Yanping Huang and Zhifeng Chen and Heng-Tze Cheng and Michael Collins and Trevor Strohman and Jilin Chen and Alex Beutel and Ahmad Beirami},
  journal= {arXiv preprint arXiv:2310.17022},
  year   = {2024}
}

备注

ICML 2024