中文

衡量大型语言模型多国价值对齐性的基准测试

计算与语言 2025-04-22 v2 人工智能

摘要

大型语言模型(LLM)是否持有与您国家价值观相冲突的立场?偶尔会这样!然而,现有工作主要聚焦于伦理审查,未能捕捉民族价值多样性,这些价值涵盖更广泛的政策、法律和道德考量。此外,当前依赖人工设计问卷量表测试的基准测试难以实现可扩展性。为此,我们提出了NaVAB(National Value Alignment Benchmark),一个全面的基准测试,用于评估大型语言模型与五大国家(中国、美国、英国、法国、德国)价值观的对齐程度。NaVAB实现了国家价值提取管道,以高效构建价值评估数据集。具体而言,我们提出了一种带指令标记的建模流程处理原始数据源,提出了筛选过程以过滤价值相关主题,并通过冲突减少机制过滤非冲突价值。我们在跨国家的各种大型语言模型上进行了大规模实验,结果为识别误对齐场景提供了洞见。此外,我们展示了NaVAB可以与对齐技术结合,有效减少价值顾虑,通过与目标国家的价值观对齐来实现这一目标。

关键词

引用

@article{arxiv.2504.12911,
  title  = {Benchmarking Multi-National Value Alignment for Large Language Models},
  author = {Weijie Shi and Chengyi Ju and Chengzhong Liu and Jiaming Ji and Jipeng Zhang and Ruiyuan Zhang and Jia Zhu and Jiajie Xu and Yaodong Yang and Sirui Han and Yike Guo},
  journal= {arXiv preprint arXiv:2504.12911},
  year   = {2025}
}