中文

CMoralEval:中文大语言模型道德评估基准

计算与语言 2024-08-20 v1 人工智能

摘要

大语言模型(LLM)在伦理相关语境中会如何回应?本文策划了一个用于中文LLM道德评估的大规模基准CMoralEval。CMoralEval的数据来源 twofold:1)一个讨论中国社会道德规范的中国电视节目,以及2)来自各种报纸和道德学术论文的中国道德反常合集。利用这些来源,本文旨在创建一个以多样性和真实性为特征的道德评估数据集。本文开发了道德分类体系和一套基本道德原则,这些原则不仅根植于中国传统文化,也与当代社会规范一致。为促进CMoralEval中实例的高效构建和标注,本文建立了一个AI辅助实例生成平台以简化标注流程。这些工作帮助本文策划了CMoralEval,涵盖显性道德场景(14,964个实例)和道德困境场景(15,424个实例),每个场景均包含来自不同数据来源的实例。本文利用CMoralEval对多种中文LLM进行了广泛实验。实验结果表明CMoralEval对中文LLM而言是一个具有挑战性的基准。该数据集公开可用,地址为\url{https://github.com/tjunlp-lab/CMoralEval}。

关键词

引用

@article{arxiv.2408.09819,
  title  = {CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models},
  author = {Linhao Yu and Yongqi Leng and Yufei Huang and Shang Wu and Haixin Liu and Xinmeng Ji and Jiahui Zhao and Jinwang Song and Tingting Cui and Xiaoqing Cheng and Tao Liu and Deyi Xiong},
  journal= {arXiv preprint arXiv:2408.09819},
  year   = {2024}
}

备注

Accepted by ACL 2024 (Findings)