中文

Value Imprint: 一种审计 RLHF 数据集中内嵌人类价值观的技术

机器学习 2024-11-20 v1 人工智能

摘要

LLM 越来越多地使用 RLHF 数据集进行微调,以使其与人类偏好和价值观对齐。然而,关于哪些特定的人类价值观通过这些数据集得以体现的研究非常有限。在本文中,我们引入了 Value Imprint,这是一个用于审计和分类 RLHF 数据集中内嵌人类价值观的框架。为了研究该框架的可行性,我们通过审计 Anthropic/hh-rlhf、OpenAI WebGPT Comparisons 和 Alpaca GPT-4-LLM 数据集进行了三个案例研究实验,以检验其中内嵌的人类价值观。我们的分析包含两个阶段。在第一阶段,我们通过对哲学、价值学和伦理学的前期工作进行综合回顾,构建了人类价值观分类体系。然后,我们应用该分类体系对 6,501 条 RLHF 偏好进行了标注。在第二阶段,我们将标注生成的标签作为真实数据,用于训练基于 Transformer 的机器学习模型,以审计和分类这三个 RLHF 数据集。通过这种方法,我们发现包括智慧/知识和信息寻求在内的信息效用价值观是所有三个 RLHF 数据集中最主要的人类价值观。相比之下,包括福祉、正义和人类/动物权利在内的亲社会和民主价值观是代表性最弱的人类价值观。这些发现对于开发符合社会价值观和规范的语言模型具有重要意义。我们公开了我们的数据集以支持该领域的进一步研究。

关键词

引用

@article{arxiv.2411.11937,
  title  = {Value Imprint: A Technique for Auditing the Human Values Embedded in RLHF Datasets},
  author = {Ike Obi and Rohan Pant and Srishti Shekhar Agrawal and Maham Ghazanfar and Aaron Basiletti},
  journal= {arXiv preprint arXiv:2411.11937},
  year   = {2024}
}