面向事实核查的声明抽取:数据、模型与自动化度量
计算与语言
2025-02-10 v1
摘要
本文中,我们利用一对多文本生成方法探索声明抽取问题,比较了大语言模型(LLM)、为此任务微调的小型摘要模型以及先前基于命名实体识别的基线模型QACG。鉴于当前关于声明抽取、事实抽取、声明生成和可核查声明检测的出版物在方法和术语上相当分散,我们梳理了它们的共同目标,发布了FEVERFact数据集,该数据集包含从4,000个语境化的维基百科句子中抽取的17,000条原子事实声明,改编自原始的FEVER数据集。我们将已知的目标整合到一个评估框架中:对每条生成的声明分别检查其原子性、流畅性、去语境化和忠实度,并针对单个输入的所有预测声明集合衡量聚焦度和覆盖率。对于每个度量指标,我们通过将其归约为一个已探索的自然语言处理(NLP)任务来实现一个评分标准。我们根据人类对通用声明的评分验证了我们的度量指标,结果表明,在我们最严格的指标上,模型排名没有变化,并且该评估框架在和RMSE方面非常接近人类评分。
引用
@article{arxiv.2502.04955,
title = {Claim Extraction for Fact-Checking: Data, Models, and Automated Metrics},
author = {Herbert Ullrich and Tomáš Mlynář and Jan Drchal},
journal= {arXiv preprint arXiv:2502.04955},
year = {2025}
}