中文

CFEVER:一个中文事实验证数据集

计算与语言 2025-06-17 v1 人工智能

摘要

我们提出了CFEVER,一个用于事实验证的中文数据集。CFEVER包含基于中文维基百科内容手动创建的30,012条声明。CFEVER中的每条声明被标记为“支持”、“反驳”或“信息不足”以描述其事实程度。与FEVER数据集类似,“支持”和“反驳”类别的声明还附有来自中文维基百科单页或多页的相应证据句子。我们的标注数据集在五方标注者间一致性上达到了0.7934的Fleiss' kappa值。此外,通过使用在FEVER数据集上开发的最先进方法以及CFEVER的简单基线进行实验,我们证明了我们的数据集是一个用于事实验证的新的严格基准,可进一步用于开发自动化系统以减轻人工事实核查工作。CFEVER可在https://ikmlab.github.io/CFEVER获取。

关键词

引用

@article{arxiv.2402.13025,
  title  = {CFEVER: A Chinese Fact Extraction and VERification Dataset},
  author = {Ying-Jia Lin and Chun-Yi Lin and Chia-Jen Yeh and Yi-Ting Li and Yun-Yu Hu and Chih-Hao Hsu and Mei-Feng Lee and Hung-Yu Kao},
  journal= {arXiv preprint arXiv:2402.13025},
  year   = {2025}
}

备注

AAAI-24