中文

SEAL: 价值对齐的系统性误差分析

机器学习 2024-08-21 v1 人工智能 计算与语言

摘要

来自人类反馈的强化学习(RLHF)旨在通过基于二元偏好训练奖励模型(RMs),并利用这些奖励模型对基础语言模型进行微调,从而使语言模型(LMs)与人类价值观对齐。尽管其重要性,RLHF的内部机制仍了解甚少。本文引入了新的指标来评估建模和对齐人类价值观的有效性,即特征印记(feature imprint)、对齐阻力(alignment resistance)和对齐鲁棒性(alignment robustness)。我们将对齐数据集分为目标特征(期望的价值观)和干扰特征(不期望的概念)。通过将奖励模型得分对这些特征进行回归,我们量化了奖励模型对它们的奖励程度——这一指标我们称为特征印记。我们将对齐阻力定义为奖励模型与人类偏好不一致的偏好数据集的比例,并通过分析奖励模型对扰动输入的响应来评估对齐鲁棒性。我们的实验利用了开源组件,如Anthropic/hh-rlhf偏好数据集和OpenAssistant奖励模型,揭示了目标特征的显著印记以及对干扰特征的显著敏感性。我们观察到,在语言模型标注者与人类偏好不一致的数据集部分中,有26%的对齐阻力发生率。此外,我们发现对齐失败往往源于对齐数据集中含糊不清的条目。这些发现强调了仔细审查奖励模型和对齐数据集对于深入理解价值对齐的重要性。

关键词

引用

@article{arxiv.2408.10270,
  title  = {SEAL: Systematic Error Analysis for Value ALignment},
  author = {Manon Revel and Matteo Cargnelutti and Tyna Eloundou and Greg Leppert},
  journal= {arXiv preprint arXiv:2408.10270},
  year   = {2024}
}

备注

28 pages, 17 Figures, 8 Tables