中文

XFEVER:探索跨语言事实核查

计算与语言 2023-10-26 v1 人工智能

摘要

本文介绍了跨语言事实抽取与验证(Cross-lingual Fact Extraction and VERification, XFEVER)数据集,旨在对不同语言的事实核查模型进行基准测试。我们通过将事实抽取与验证(Fact Extraction and VERification, FEVER)数据集的声明与证据文本翻译为六种语言来构建该数据集。训练集与开发集使用机器翻译,而测试集包含专业译者翻译的文本与机器翻译文本。利用 XFEVER 数据集,本文定义了零样本学习与翻译训练学习两种跨语言事实核查场景,并针对每种场景提出了基线模型。实验结果表明,多语言语言模型可高效用于构建不同语言的事实核查模型。然而,性能因语言而异,且在一定程度上逊于英语情形。我们还发现,通过考虑英语与目标语言之间预测的相似性,可有效缓解模型误校准。XFEVER 数据集、代码与模型检查点发布于 https://github.com/nii-yamagishilab/xfever。

关键词

引用

@article{arxiv.2310.16278,
  title  = {XFEVER: Exploring Fact Verification across Languages},
  author = {Yi-Chen Chang and Canasai Kruengkrai and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2310.16278},
  year   = {2023}
}

备注

Accepted for an oral presentation at the 35th Conference on Computational Linguistics and Speech Processing (ROCLING 2023)