中文

基于贝叶斯说服的高效模型无关对齐

计算与语言 2024-05-30 v1

摘要

随着大型语言模型 (LLM) 的近期进步,对齐技术已成为有效保持 LLM 与人类意图一致性的方法。当前方法主要通过监督微调 (SFT) 或基于人类反馈的强化学习 (RLHF) 进行直接训练,均需要大量计算资源和广泛的真实数据。本文探索了一种使用小模型对大型黑箱模型进行高效对齐的方法,引入一种模型无关且轻量级的贝叶斯说服对齐框架。我们将此问题形式化为从小模型视角下的信号策略优化。在说服过程中,小模型(顾问)观察信息项目(即状态),并说服大型模型(接收者)以激发更好的响应。接收者随后根据输入、来自顾问的信号以及其对信息项目更新后的信念生成响应。通过我们的框架进行训练后,我们展示了顾问如何在广泛的任务中显著提升各种接收者的性能。我们对说服框架进行理论分析,给出顾问 regret 的上界,确认其在学习最优信号策略方面的有效性。我们的实证结果表明,GPT-2 能显著提升各种模型的性能,在数学推理能力上提升平均 16.1%,在代码生成方面提升 13.7%。我们希望我们的工作能为从贝叶斯说服视角重新思考对齐框架的初始步骤。

关键词

引用

@article{arxiv.2405.18718,
  title  = {Efficient Model-agnostic Alignment via Bayesian Persuasion},
  author = {Fengshuo Bai and Mingzhi Wang and Zhaowei Zhang and Boyuan Chen and Yinda Xu and Ying Wen and Yaodong Yang},
  journal= {arXiv preprint arXiv:2405.18718},
  year   = {2024}
}