中文

面向大语言模型的异质价值对齐评估

计算与语言 2024-01-12 v3 人工智能 人机交互 机器学习

摘要

大语言模型(LLMs)的涌现能力使得将其价值与人类价值对齐变得至关重要。然而,当前方法通常试图将价值作为LLM的一种属性来赋予,却忽视了对追求价值的能力,以及在具体实际应用里迁移异质价值的重要性。本文提出一种异质价值对齐评估(Heterogeneous Value Alignment Evaluation, HVAE)系统,用于评估LLM与异质价值对齐的成功程度。具体而言,我们的方法首先引入社会心理学中的社会价值取向(Social Value Orientation, SVO)框架,其对应于个体在自身福利与他人的福利之间所赋予的权重。我们随后为LLM赋予不同的社会价值,并衡量其行为是否与所诱导的价值一致。我们使用新的自动度量“价值理性”(value rationality)来评估LLM与特定价值对齐的能力。对五个主流LLM的价值理性进行评估后,我们察觉LLM倾向于中性价值而非显著的个体价值。通过考察这些LLM的行为,我们增进了对异质价值体系中LLM价值对齐的深入理解。

关键词

引用

@article{arxiv.2305.17147,
  title  = {Heterogeneous Value Alignment Evaluation for Large Language Models},
  author = {Zhaowei Zhang and Ceyao Zhang and Nian Liu and Siyuan Qi and Ziqi Rong and Song-Chun Zhu and Shuguang Cui and Yaodong Yang},
  journal= {arXiv preprint arXiv:2305.17147},
  year   = {2024}
}

备注

v3 is the camera-ready version for AAAI-24 Workshop on Public Sector LLMs: Algorithmic and Sociotechnical Design. 7 pages of main content, 1 page of references, 3 pages of appendices, and 7 figures. Our full prompts are released in the repo: https://github.com/zowiezhang/HVAE