DS@GT 在 CheckThat! 2025:评估数值事实验证中的上下文与分词策略
计算与语言
2025-07-09 v1
摘要
数值主张,涉及数量、比较及时间参考的陈述,为自动化事实核查系统所面临的独特挑战。本研究使用 QuanTemp 数据集评估这些主张的可信度预测建模策略,并构建自己的证据检索管道。我们检验三个关键因素:(1) 使用 ModernBERT 进行更丰富证据和更长输入上下文窗口的影响;(2) 右到左(R2L)分词的效果;(3) 两者对分类性能的综合影响。与算术推理任务中的先前发现相反,R2L 分词并未提升数值任务的自然语言推理(NLI)。更长的上下文窗口也未显著提升可信度性能,凸显了证据质量作为主要瓶颈。我们的最佳系统以 0.57 的宏平均 F1 分数取得优异成绩,位列 CheckThat! 2025 任务 3 的前四名 submissions。我们的代码已公开于 https://github.com/dsgt-arc/checkthat-2025-numerical。
引用
@article{arxiv.2507.06195,
title = {DS@GT at CheckThat! 2025: Evaluating Context and Tokenization Strategies for Numerical Fact Verification},
author = {Maximilian Heil and Aleksandar Pramov},
journal= {arXiv preprint arXiv:2507.06195},
year = {2025}
}