DVMap:通过高共识人口统计-价值映射实现细粒度多元价值对齐
人工智能
2026-05-15 v1
摘要
当前的大语言模型(LLMs)通常依赖粗粒度的国家标签进行多元价值对齐。然而,这种宏观层面的监督往往掩盖了国家内部的价值异质性,导致松散的对齐。我们认为,要解决这一局限性,需要从国家标签转向多维人口统计约束,这可以识别出具有可预测、高共识价值偏好的群体。为此,我们提出了 DVMap(高共识人口统计-价值映射),一个用于细粒度多元价值对齐的框架。在这个框架中,我们首先提出了一种人口统计原型提取策略,通过严格保留在相同人口统计下具有一致价值偏好的受访者,从世界价值观调查(WVS)构建了一个包含 56,152 个样本的高质量价值对齐语料库。在此语料库上,我们引入了结构化思维链机制,显式地指导 LLM 推理人口统计与价值的相关性。随后,我们采用群组相对策略优化(GRPO)来实现价值分布的自适应锚定。为了严格评估泛化能力,我们进一步建立了一个包含 21,553 个样本的三重泛化基准测试(跨越跨人口统计、跨国家和跨价值)。实验结果表明,DVMap 有效地学习了从人口统计到价值的流形映射,展现出强大的泛化能力和鲁棒性。在跨人口统计测试中,Qwen3-8B-DVMap 达到了 48.6% 的准确率,超越了先进开源 LLM DeepSeek-v3.2(45.1%)。源代码和数据集可在 https://github.com/EnlightenedAI/DVMap 获取。
引用
@article{arxiv.2605.14420,
title = {DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping},
author = {Pengyun Zhu and Yuqi Ren and Zhen Wang and Lei Yang and Deyi Xiong},
journal= {arXiv preprint arXiv:2605.14420},
year = {2026}
}
备注
Accepted to the Main Conference of ACL 2026