分解式主张验证中的对齐瓶颈
计算与语言
2026-02-12 v1 人工智能
摘要
结构化主张分解常被提议作为验证复杂多面主张的方法,但实证结果不一。我们认为,这些不一致性源自两个被忽视的瓶颈:证据对齐和子主张错误特征。为更好地理解这些因素,我们引入了一个新的真实世界复杂主张数据集,包含时间受限的证据和人工标注的子主张证据范围。我们评估了两种证据对齐设置:子主张对齐证据(SAE)和重复主张层面证据(SRE)。我们的结果表明,只有在证据细粒度且严格对齐时,分解才会带来显著的性能提升。相比之下,依赖重复主张层面证据(SRE)的标准设置未能提升性能,甚至会因数据集和领域(PHEMEPlus、MMM-Fact、COVID-Fact)的不同而导致性能下降。此外,我们进一步表明,在噪声子主张标签的存在下,错误类型决定了下游鲁棒性。我们发现,保守的"放弃"显著减少了错误传播,而激进但错误的预测则相反。这些发现表明,未来的主张分解框架必须优先考虑精确的证据合成,并校准子主张验证模型的标签偏差。
引用
@article{arxiv.2602.10380,
title = {The Alignment Bottleneck in Decomposition-Based Claim Verification},
author = {Mahmud Elahi Akhter and Federico Ruggeri and Iman Munire Bilal and Rob Procter and Maria Liakata},
journal= {arXiv preprint arXiv:2602.10380},
year = {2026}
}