中文

通过表示工程使大型语言模型与人类偏好对齐

计算与语言 2024-07-04 v3

摘要

使大型语言模型(LLM)与人类偏好对齐对于提升其在有用性、真实性、安全性、无害性和趣味性方面的效用至关重要。现有实现这种对齐的方法通常涉及利用来自人类反馈的强化学习(RLHF),基于人类对模型响应相对质量的评估标签来微调 LLM。然而,RLHF 在微调过程中容易不稳定,且实施面临挑战。受新兴的表示工程(RepE)领域启发,本研究旨在识别嵌入在 LLM 活动模式中的高层人类偏好的相关表示,并通过转换其表示来实现对模型行为的精确控制。这种称为“来自人类反馈的表示对齐”(RAHF)的新方法被证明是有效、计算高效且易于实施的。大量实验表明,RAHF 不仅能捕捉还能操纵表示以与广泛的人类偏好或价值观对齐,而不仅限于单一概念或功能(例如诚实或偏见)。RAHF 在适应多样化人类偏好方面的多功能性显示了其提升 LLM 性能的潜力。

关键词

引用

@article{arxiv.2312.15997,
  title  = {Aligning Large Language Models with Human Preferences through Representation Engineering},
  author = {Wenhao Liu and Xiaohua Wang and Muling Wu and Tianlong Li and Changze Lv and Zixuan Ling and Jianhao Zhu and Cenyuan Zhang and Xiaoqing Zheng and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2312.15997},
  year   = {2024}
}