CORECODE:面向中文大语言模型的常识标注对话数据集与基准任务
计算与语言
2023-12-21 v1
摘要
作为智能不可或缺的要素,常识推理对于大语言模型(LLM)在真实场景中的应用至关重要。本文提出 CORECODE,一个在二元对话上人工标注丰富常识知识的数据集,用于评估中文 LLM 的常识推理与常识冲突检测能力。我们将日常对话中的常识知识划分为三个维度:实体、事件和社交互动。为了便于标注并保持一致性,我们将开放域对话中的常识知识标注形式标准化为“domain: slot = value”。共定义了 9 个 domain 和 37 个 slot 以捕捉多样的常识知识。基于这些预定义的 domain 和 slot,我们通过众包从 19,700 个对话中收集了 76,787 条常识知识标注。为了在整理好的数据集上评估和增强 LLM 的常识推理能力,我们建立了一系列对话级别的推理和检测任务,包括常识知识填充、常识知识生成、常识冲突短语检测、domain 识别、slot 识别和事件因果推断。我们在数据集上使用这些任务评估了多种现有的开源中文 LLM。实验结果表明,这些模型无法胜任预测 CORECODE 中丰富的推理内容,甚至 ChatGPT 在零样本设置下的 domain 识别和 slot 识别任务中也仅分别达到 0.275 和 0.084 的准确率。我们在 https://github.com/danshi777/CORECODE 发布了 CORECODE 的数据和代码,以促进日常对话语境下 LLM 的常识推理评估与研究。
引用
@article{arxiv.2312.12853,
title = {CORECODE: A Common Sense Annotated Dialogue Dataset with Benchmark Tasks for Chinese Large Language Models},
author = {Dan Shi and Chaobin You and Jiantao Huang and Taihao Li and Deyi Xiong},
journal= {arXiv preprint arXiv:2312.12853},
year = {2023}
}
备注
AAAI 2024