SciClaimEval:科学论文中的跨模态论点验证
计算与语言
2026-02-16 v2
摘要
我们提出 SciClaimEval,一个新的科学声明验证数据集。与现有资源不同,SciClaimEval 包含从已发表论文中直接抽取的真实声明,包括被驳斥的声明。为创建被驳斥的声明,我们引入一种新方法,通过修改支持证据(图表)来实现,而非改变声明或依赖大型语言模型(LLM)制造矛盾。数据集提供跨模态证据,包含多种表征形式:图作为图像提供,而表格以图像、LaTeX 源码、HTML 和 JSON 多种格式提供。SciClaimEval 包含 1664 组经过专家标注的样本,来自机器学习、自然语言处理和医学三个领域的 180 篇论文。我们对 11 个多模态基础模型(包括开源和商业模型)进行基准测试。结果显示,图基验证对所有模型都具有挑战性,因为最佳系统与人类基准之间仍存在显著的性能差距。
引用
@article{arxiv.2602.07621,
title = {SciClaimEval: Cross-modal Claim Verification in Scientific Papers},
author = {Xanh Ho and Yun-Ang Wu and Sunisth Kumar and Tian Cheng Xia and Florian Boudin and Andre Greiner-Petter and Akiko Aizawa},
journal= {arXiv preprint arXiv:2602.07621},
year = {2026}
}
备注
Accepted at LREC 2026; 12 pages; data is available at https://sciclaimeval.github.io/