证据单元:面向解析器无关检索的本体驱动文档组织
信息检索
2026-04-02 v1
摘要
结构化文档——表格配标题、图配说明、方程配解释段落——在索引检索时通常被碎片化。元素级索引将每个解析元素视为独立片段,使语义连贯的单元分散在不同的检索候选中。本文提出一个解析器无关的流水线,用于构建证据单元(EUs):将视觉资产与其上下文文本分组的语义完整文档片段。我们做出四项贡献:(1) 扩展DoCO的本体驱动角色归一化,将异构解析器输出映射到统一语义模式;(2) 基于全相似度矩阵的语义全局分配算法,通过最优分配段落到EUs;(3) Neo4j中基于图的决策层,形式化EU构建规则并通过两个不变量验证完整性;(4) 跨解析器验证表明EU的空间足迹在MinerU和Docling之间收敛,且增益在解析器诱导的bbox方差下保持。在OmniDocBench v1.0(1340页;1551个QA对)上的实验表明,基于EU的分块使检索LCS提升+0.31(从0.50到0.81)。Recall@1从0.15提升至0.51(3.4倍),MinK从2.58降至1.72。跨解析器结果确认增益(LCS +0.23至+0.31)在各解析器间保持。文本查询的增益最为显著:Recall@1从0.08升至0.47。
引用
@article{arxiv.2604.00500,
title = {Evidence Units: Ontology-Grounded Document Organization for Parser-Independent Retrieval},
author = {Yeonjee Han},
journal= {arXiv preprint arXiv:2604.00500},
year = {2026}
}
备注
16 pages, 4 figures