中文

MVPBench:面向多样化人类价值观的大语言模型对齐基准测试与微调框架

计算与语言 2025-09-17 v2 人工智能

摘要

将大语言模型(LLM)与人类价值观对齐,对于其在多样化用户群体中的安全有效部署至关重要。然而,现有基准测试往往忽视文化和人口统计多样性,导致对价值观对齐在全球范围内的泛化能力理解有限。在本工作中,我们提出了MVPBench,一个新颖的基准测试,系统地评估LLM在75个国家中对多维度人类价值偏好的对齐程度。MVPBench包含24,020条高质量实例,标注了细粒度的价值标签、个性化问题以及丰富的元数据,使其成为迄今为止最全面的同类资源。利用MVPBench,我们对多个最先进LLM进行了深入分析,揭示了在对齐性能上存在显著的地理和人口统计差异。我们进一步证明,轻量级微调方法,如低秩自适应(LoRA)和直接偏好优化(DPO),可以显著提升在域内和域外设置下的价值观对齐。我们的发现强调了面向人口统计感知的对齐评估的必要性,并为构建文化适应性强、价值观敏感的大语言模型提供了可操作的见解。MVPBench为全球对齐、个性化价值建模和公平AI发展方面的未来研究提供了实用基础。

关键词

引用

@article{arxiv.2509.08022,
  title  = {MVPBench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values},
  author = {Yao Liang and Dongcheng Zhao and Feifei Zhao and Guobin Shen and Yuwei Wang and Dongqi Liang and Yi Zeng},
  journal= {arXiv preprint arXiv:2509.08022},
  year   = {2025}
}

备注

Some parts of the paper need to be revised. We would therefore like to withdraw the paper and resubmit it after making the necessary changes