调查到行为:通过调查问题实现 LLM 中人类价值观的下游对齐
计算与语言
2025-08-18 v1
摘要
大语言模型隐式地编码了人类价值观的偏好,但引导其行为通常需要大量训练数据。在本工作中,我们研究了一种简单的方法:能否通过训练模型按相应方式回答价值观调查问题来可靠地修改模型的价值观系统?我们首先通过询问多个开源 LLMs 对涵盖 20 种不同人类价值观的一系列价值观相关描述进行评分,构建了这些模型的价值观档案,作为后续实验的基线。然后我们调查模型的价值观系统是否可以通过在价值观调查上微调来控制。我们以两种方式评估微调对模型行为的影响:第一,评估模型在域内保留调查问题上的答案变化。第二,评估模型在域外设置(情境场景)中的行为变化。为此,我们基于 Reddit 帖子构建了一个上下文相关的道德判断数据集,并评估模型在文本冒险游戏中的行为变化。我们证明,这种简单方法不仅能够改变模型对域内调查问题的回答,还能在隐式下游任务行为中产生显著变化(价值观对齐)。
引用
@article{arxiv.2508.11414,
title = {Survey-to-Behavior: Downstream Alignment of Human Values in LLMs via Survey Questions},
author = {Shangrui Nie and Florian Mai and David Kaczér and Charles Welch and Zhixue Zhao and Lucie Flek},
journal= {arXiv preprint arXiv:2508.11414},
year = {2025}
}
备注
7 pages 1 figure