用于可调节多元价值对齐的大语言模型的反事实推理
人工智能
2025-12-08 v2 机器学习
摘要
随着大型语言模型(LLM)越来越多地集成到服务跨越不同文化、社区和人口统计学的应用程序中,对将LLM对齐到多元化人类价值观(超越平均原则,如HHH)至关重要。在心理学和社会价值理论(如沙克夫价值理论)中,多元价值观由多个价值维度配对 various priorities 表示。然而,现有方法在对齐此类细粒度价值目标时面临两个挑战:1)它们常常将多个价值视为独立且同样重要的,忽略它们的相互依赖性和相对优先级(价值复杂性);2)它们难以精确控制细微的价值优先级,尤其是那些被低估的价值(价值可调性)。为处理这些挑战,我们提出了COUPLE,这是一个面向多元价值对齐的COUnterfactual reasoning框架。它引入了结构因果模型(SCM),用于刻画特征之间的复杂相互依赖和优先级,以及高层次价值维度与行为之间的因果关系。此外,它应用反事实推理以生成符合任何期望价值目标的输出。凭借显式的因果建模,COUPLE还提供更好的可解释性。我们在具有不同价值体系的数据集上评估了COUPLE,结果表明COUPLE在多种价值目标类型上均优于其他基线方法。
引用
@article{arxiv.2510.18526,
title = {Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models},
author = {Hanze Guo and Jing Yao and Xiao Zhou and Xiaoyuan Yi and Xing Xie},
journal= {arXiv preprint arXiv:2510.18526},
year = {2025}
}
备注
NeurIPS 2025. 41 pages, 7 figures