中文

CValues:从安全性到责任性衡量中文大语言模型的价值观

计算与语言 2023-07-20 v1

摘要

随着大语言模型(LLMs)的快速发展,人们日益担忧其可能带来风险或产生负面社会影响。因此,人类价值观对齐的评估正变得愈发重要。以往工作主要聚焦于评估 LLMs 在特定知识与推理能力上的表现,而忽视了对人类价值观的对齐,尤其是在中文语境下。本文提出 CValues,首个中文人类价值观评估基准,用于从安全性与责任性双重准则衡量 LLMs 的对齐能力。具体而言,我们由专业专家人工收集了涵盖 10 个场景的对抗性安全提示,并归纳出源自 8 个领域的责任性提示。为提供对中文 LLMs 全面的价值观评估,我们不仅开展人工评估以实现可靠比较,还构建了多选题提示用于自动评估。我们的发现表明,尽管大多数中文 LLMs 在安全性方面表现良好,其在责任性方面仍有相当大的改进空间。此外,自动与人工评估对于从不同侧面衡量人类价值观对齐均十分重要。该基准与代码已发布于 ModelScope 与 Github。

关键词

引用

@article{arxiv.2307.09705,
  title  = {CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility},
  author = {Guohai Xu and Jiayi Liu and Ming Yan and Haotian Xu and Jinghui Si and Zhuoran Zhou and Peng Yi and Xing Gao and Jitao Sang and Rong Zhang and Ji Zhang and Chao Peng and Fei Huang and Jingren Zhou},
  journal= {arXiv preprint arXiv:2307.09705},
  year   = {2023}
}

备注

Working in Process