大语言模型能否从人类层面提取细粒度证据用于基于证据的事实核查?
计算与语言
2025-11-27 v1
摘要
错误信息经常在在线新闻评论下传播,凸显了检测事实不正确信息的必要性。为强有力地支持或驳斥从这些评论中提取的论点,必须识别相关文档并精准定位证据的具体文本片段。本文聚焦于后者——捷克语和斯洛伐克语论点的细粒度证据提取。我们构建了新的数据集,包含由付费标注员创建的双向标注的细粒度证据。我们对大型语言模型(LLMs)在该数据集上的表现进行评估,以衡量其与人类标注的一致性。结果显示,LLM 常常未能从源文本中逐字复制证据,导致无效输出。错误率分析表明,尽管规模较小,llama3.1:8b 模型实现了较高比例的正确输出,而 gpt-oss-120b 模型尽管参数众多却表现不佳。此外,qwen3:14b、deepseek-r1:32b 和 gpt-oss:20b 模型在模型规模与人类标注一致性之间展现了有效的平衡。
引用
@article{arxiv.2511.21401,
title = {Can LLMs extract human-like fine-grained evidence for evidence-based fact-checking?},
author = {Antonín Jarolím and Martin Fajčík and Lucia Makaiová},
journal= {arXiv preprint arXiv:2511.21401},
year = {2025}
}