中文

分布偏好学习:理解并考虑RLHF中的隐藏上下文

机器学习 2024-04-18 v2 人工智能 机器学习

摘要

在实践中,基于人类反馈的偏好学习依赖于包含隐藏上下文的不完整数据。隐藏上下文指的是那些影响所获反馈,但并未在用于训练偏好模型的数据中体现的数据。这涵盖了数据收集中的常见问题,例如人类标注者偏好各异、导致看似非理性行为的认知过程,以及合并根据不同标准标注的数据。我们证明,偏好学习的标准应用,包括基于人类反馈的强化学习(RLHF),会依据一种称为波达计数法的著名投票规则,隐式地在隐藏上下文上进行聚合。我们表明,这可能产生与通过期望效用进行隐式聚合的其他方法截然不同的反直觉结果。此外,我们的分析形式化了从具有不同价值观的用户进行偏好学习时,如何隐式地实现社会选择函数。这一结果的一个关键含义是,标注者有动机误报其偏好以影响所学模型,从而导致RLHF部署中的漏洞。作为缓解这些问题的一步,我们引入了一类称为分布偏好学习(DPL)的方法。DPL方法为每个备选项估计一个可能分数值的分布,以更好地解释隐藏上下文。实验结果表明,将DPL应用于大语言模型聊天机器人的RLHF,能够识别数据中的隐藏上下文,并显著降低后续越狱攻击的脆弱性。我们的代码和数据可在https://github.com/cassidylaidlaw/hidden-context获取。

关键词

引用

@article{arxiv.2312.08358,
  title  = {Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF},
  author = {Anand Siththaranjan and Cassidy Laidlaw and Dylan Hadfield-Menell},
  journal= {arXiv preprint arXiv:2312.08358},
  year   = {2024}
}

备注

Presented at ICLR 2024