文档级表格数值交叉检查:粗到细方法
计算与语言
2025-06-17 v1
摘要
披露文件中跨表格的数值一致性对于确保准确性、维护可信度以及避免声誉和经济风险至关重要。自动化的表格数值交叉检查面临两个重大挑战:(C1)在文档级别管理组合爆炸的候选实例,(C2)理解多方位的数值语义。以往的研究通常依赖基于启发式的方法进行过滤或简化的上下文提取,往往难以在性能和效率之间取得平衡。最近,大型语言模型(LLM)展示出惊人的上下文理解能力有助于在实例级别解决C2问题,但仍受计算效率(C1)和有限领域专业知识的限制。本文引入CoFiTCheck,一种新型LLM驱动的粗到细框架,通过两个顺序阶段来解决这些挑战:嵌入式过滤和判别性分类。嵌入式过滤阶段引入一种指令并行编码方法,有效地用LLM表示表格中所有数值提及,以及解耦的InfoNCE目标,以缓解孤立提及问题。判别性分类阶段采用专用的LLM进行剩余候选对的细粒度分析。该阶段通过我们提出的跨表格数值对齐预训练范式得到进一步增强,后者利用跨表格数值相等关系的弱监督来丰富任务特定的先验,而无需手动标注。对三类真实世界披露文件进行的全面评估表明,CoFiTCheck显著优于以往方法,同时保持实际效率。
引用
@article{arxiv.2506.13328,
title = {Document-Level Tabular Numerical Cross-Checking: A Coarse-to-Fine Approach},
author = {Chaoxu Pang and Yixuan Cao and Ganbin Zhou and Hongwei Li and Ping Luo},
journal= {arXiv preprint arXiv:2506.13328},
year = {2025}
}
备注
Submitted to IEEE TKDE