中文

CKnowEdit:面向大语言模型中语言学、事实与逻辑错误纠正的新中文知识编辑数据集

计算与语言 2025-06-03 v4 人工智能 信息检索 机器学习

摘要

中文作为一个深度和复杂性丰富的语言系统,其特点是包含古诗词、谚语、成语等独特的文化结构。然而,当前的大语言模型(LLMs)在这些专业领域面临局限性,这凸显了开发全面数据集的需求,这些数据集能够通过有针对性的训练优化来评估、持续更新并逐步提升这些基于文化的语言能力。为弥补这一差距,我们引入了 CKnowEdit,这是首个旨在纠正大语言模型中语言、事实和逻辑错误的中文知识编辑数据集。我们从广泛的来源收集了七种类型的知识,包括经典文本、成语以及来自百度贴吧弱智吧的内容,并考虑到了中文特有的多音字、对仗和逻辑结构。通过分析该数据集,我们强调了当前大语言模型在掌握中文方面面临的挑战。此外,我们对最先进的知识编辑技术的评估揭示了推进中文知识纠正的机会。代码和数据集可在 https://github.com/zjunlp/EasyEdit 获取。

关键词

引用

@article{arxiv.2409.05806,
  title  = {CKnowEdit: A New Chinese Knowledge Editing Dataset for Linguistics, Facts, and Logic Error Correction in LLMs},
  author = {Jizhan Fang and Tianhe Lu and Yunzhi Yao and Ziyan Jiang and Xin Xu and Huajun Chen and Ningyu Zhang},
  journal= {arXiv preprint arXiv:2409.05806},
  year   = {2025}
}

备注

ACL 2025; project website is available at https://zjunlp.github.io/project/CKnowEdit code and dataset are available at https://github.com/zjunlp/EasyEdit