面向几乎任何语言的自动化事实核查流水线与数据集生成
计算与语言
2024-08-23 v1
摘要
本文提出了一种利用公开语言模型和数据的自动化事实核查流水线。目标是使用来自真实证据语料库的证据评估文本声明的准确性。该流水线由两个主要模块组成——证据检索和声明真实性评估。我们主要关注在自动化事实核查领域尚未探索的各种语言中的易部署性。与大多数在句子级别处理证据的类似流水线不同,我们的流水线在段落级别处理数据,从而简化了整体架构和数据需求。鉴于注释特定语言的事实核查训练数据成本高昂,我们的解决方案基于用于声明生成的问答(QACG)方法,我们对其进行调整并用于生成流水线所有模型的数据。我们的策略通过机器翻译仅两个固定大小的数据集来引入新语言。随后,可以基于目标语言的证据语料库生成任意数量的训练样本。我们为捷克语、英语、波兰语和斯洛伐克语流水线提供所有数据和微调模型的开源访问,以及可用于重现结果的代码库。我们对所有四种语言的流水线进行了全面评估,包括人工注释和使用逐点V信息进行每样本难度评估。所呈现的实验基于完整的Wikipedia快照以促进可重复性。为便于实现和用户交互,我们开发了FactSearch应用程序,其中包含所提出的流水线及其性能的初步反馈。
引用
@article{arxiv.2312.10171,
title = {Pipeline and Dataset Generation for Automated Fact-checking in Almost Any Language},
author = {Jan Drchal and Herbert Ullrich and Tomáš Mlynář and Václav Moravec},
journal= {arXiv preprint arXiv:2312.10171},
year = {2024}
}
备注
submitted to NCAA journal for review