中文

C-VARC:面向大语言模型价值对齐的大规模中文价值规则语料库

计算与语言 2026-01-05 v5

摘要

确保大语言模型(LLMs)符合主流人类价值观和伦理规范,对于人工智能的安全和可持续发展至关重要。当前的价值评估和对齐受到西方文化偏见以及依赖非原生规则的不完整国内框架的制约;此外,缺乏可扩展的、规则驱动的场景生成方法,使得评估成本高昂且在不同文化背景下不够充分。为了应对这些挑战,我们提出了一个基于中国核心价值观的分层价值框架,包含三个主要维度、12 个核心价值和 50 个衍生价值。基于该框架,我们构建了一个包含超过 250,000 条价值规则的大规模中文价值规则语料库(C-VARC),并通过人工标注进行了增强和扩充。实验结果表明,与直接生成的内容相比,由 C-VARC 引导的场景表现出更清晰的价值边界和更大的内容多样性。在针对六个敏感主题(如代孕、自杀)的评估中,七个主流 LLMs 在超过 70.5% 的情况下更倾向于 C-VARC 生成的选项,而五名中文人工标注者与 C-VARC 的一致性达到 87.5%,证实了其普适性、文化相关性以及与中国价值观的强一致性。此外,我们构建了 400,000 个基于规则的道德困境场景,客观地捕捉了 17 个 LLMs 在冲突价值优先级排序上的细微差异。我们的工作建立了一个具有文化适应性的基准测试框架,用于全面的价值评估和对齐,体现了中国特色。

关键词

引用

@article{arxiv.2506.01495,
  title  = {C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models},
  author = {Ping Wu and Guobin Shen and Dongcheng Zhao and Yuwei Wang and Yiting Dong and Yu Shi and Enmeng Lu and Feifei Zhao and Yi Zeng},
  journal= {arXiv preprint arXiv:2506.01495},
  year   = {2026}
}