中文

理解在线与离线对齐算法之间的性能差距

机器学习 2024-05-15 v1 人工智能

摘要

人类反馈强化学习(RLHF)是大语言模型对齐的规范框架。然而,离线对齐算法日益流行,对RLHF中同策略采样的必要性提出了挑战。在奖励过度优化的背景下,我们首先进行了一组实验,展示了在线方法相对于离线方法的明显优势。这促使我们通过一系列精心设计的实验消融来研究性能差异的原因。我们通过实验表明,诸如离线数据覆盖率和数据质量等假设本身无法令人信服地解释这种性能差异。我们还发现,虽然离线算法训练的策略在成对分类上表现良好,但在生成方面表现较差;与此同时,在线算法训练的策略在生成方面表现良好,而在成对分类上表现较差。这暗示了判别能力与生成能力之间存在独特的相互作用,且这种相互作用受采样过程的极大影响。最后,我们观察到,对于对比损失和非对比损失函数,性能差异均持续存在,且似乎无法通过简单扩大策略网络规模来解决。总而言之,我们的研究揭示了同策略采样在AI对齐中的关键作用,并暗示了离线对齐算法存在某些根本性挑战。

关键词

引用

@article{arxiv.2405.08448,
  title  = {Understanding the performance gap between online and offline alignment algorithms},
  author = {Yunhao Tang and Daniel Zhaohan Guo and Zeyu Zheng and Daniele Calandriello and Yuan Cao and Eugene Tarassov and Rémi Munos and Bernardo Ávila Pires and Michal Valko and Yong Cheng and Will Dabney},
  journal= {arXiv preprint arXiv:2405.08448},
  year   = {2024}
}