中文

Proxy-RLHF:利用代理解耦大语言模型的生成与对齐

计算与语言 2024-03-08 v1 人工智能 机器学习

摘要

基于人类反馈的强化学习(RLHF)是确保大语言模型(LLMs)与人类价值观对齐的主流方法。然而,现有的 RLHF 方法需要高昂的计算成本,主要原因在于 RLHF 同时将生成和对齐任务分配给 LLM。在本文中,我们介绍了 Proxy-RLHF,该方法解耦了 LLM 的生成和对齐过程,以更低的计算成本实现与人类价值观的对齐。我们从一个专为对齐过程设计的新型马尔可夫决策过程(MDP)开始,并采用强化学习(RL)训练一个精简的代理模型来监督 LLM 的 token 生成,而无需改变 LLM 本身。实验表明,我们的方法仅使用其他方法 1% 的训练参数即可实现相当水平的对齐。

关键词

引用

@article{arxiv.2403.04283,
  title  = {Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy},
  author = {Yu Zhu and Chuxiong Sun and Wenfei Yang and Wenqiang Wei and Bo Tang and Tianzhu Zhang and Zhiyu Li and Shifeng Zhang and Feiyu Xiong and Jie Hu and Mingchuan yang},
  journal= {arXiv preprint arXiv:2403.04283},
  year   = {2024}
}