中文

Snowman:从基础模型蒸馏得到的百万级中文常识知识图谱

计算与语言 2023-06-21 v1 人工智能

摘要

构建常识知识图谱(CKG)因其在认知智能中的重要意义而受到广泛研究关注。然而,现有 CKG 通常面向英语,限制了非英语语言中的研究。同时,以 ChatGPT 和 GPT-4 为代表的基础模型借助基于人类反馈的强化学习展现出令人瞩目的智能。在此背景下,本文利用基础模型构建了一个名为 Snowman 的中文 CKG。具体而言,我们从 ChatGPT 中蒸馏不同类型的常识头实体,并继续使用它针对头实体与预定义关系收集尾实体。基于初步分析,我们发现 ChatGPT 蒸馏得到的负向常识知识相较于其他知识具有较低的人类接受度。因此,我们设计了一种简单而有效的自指令过滤策略以滤除无效负向常识。总体而言,构建的 Snowman 覆盖超过一千万条中文常识三元组,成为最大的中文 CKG。此外,人工研究表明 Snowman 的接受度达到 90.6%,表明由前沿基础模型蒸馏得到的三元组具有高质量。我们还在常识知识模型上进行了实验以展示 Snowman 的可用性与有效性。

关键词

引用

@article{arxiv.2306.10241,
  title  = {Snowman: A Million-scale Chinese Commonsense Knowledge Graph Distilled from Foundation Model},
  author = {Jiaan Wang and Jianfeng Qu and Yunlong Liang and Zhixu Li and An Liu and Guanfeng Liu and Xin Zheng},
  journal= {arXiv preprint arXiv:2306.10241},
  year   = {2023}
}

备注

tech report