中文大语言模型幻觉评测
计算与语言
2023-10-26 v4
摘要
本文建立了一个名为 HalluQA(中文幻觉问答)的基准,用于衡量中文大语言模型中的幻觉现象。HalluQA 包含 450 道精心设计的对抗性问题,涵盖多个领域,并考虑了中国的历史文化、习俗与社会现象。在 HalluQA 的构建过程中,我们考虑了两类幻觉:模仿性虚假与事实性错误,并基于 GLM-130B 和 ChatGPT 构造对抗样本。在评测方面,我们设计了一种使用 GPT-4 的自动化评测方法,以判断模型输出是否存在幻觉。我们在 24 个大语言模型上进行了广泛实验,包括 ERNIE-Bot、Baichuan2、ChatGLM、Qwen、SparkDesk 等。在这 24 个模型中,有 18 个的非幻觉率低于 50%,表明 HalluQA 具有极高的挑战性。我们分析了不同类型模型中幻觉的主要类型及其成因,并讨论了不同类型模型应优先处理哪些类型的幻觉。
引用
@article{arxiv.2310.03368,
title = {Evaluating Hallucinations in Chinese Large Language Models},
author = {Qinyuan Cheng and Tianxiang Sun and Wenwei Zhang and Siyin Wang and Xiangyang Liu and Mozhi Zhang and Junliang He and Mianqiu Huang and Zhangyue Yin and Kai Chen and Xipeng Qiu},
journal= {arXiv preprint arXiv:2310.03368},
year = {2023}
}
备注
Work in progress