中文

超越拼贴:通过文本监督学习全局布局用于晚期交互视觉文档检索

计算机视觉与模式识别 2026-05-12 v1

摘要

视觉文档检索(VDR)模型大多依赖晚期交互架构,其中文档由局部补丁嵌入集合表示,然后与查询标记匹配。虽然高效,但这种架构优先考虑局部相似性而非文档查询相关性的全局布局结构。在实际中,这会导致错误,因为相关性来自混合了图形、表格和文本的异构布局文档的布局结构。我们在不改变推理的前提下使文档布局可学习。我们提出了一种多模态编码器,通过训练文本描述来增强局部补丁表示中的全局布局嵌入。跨越四个 ViDoRe-v2 数据集,我们的模型相对于最强的 architecturally comparable ColPali/ColQwen baseline 提升了 +2.4 nDCG@5 和 +2.3 MAP@5, statistically significant per-dataset gains over ColQwen。

关键词

引用

@article{arxiv.2605.08421,
  title  = {Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval},
  author = {Pascal Tilli and Mohsen Mesgar},
  journal= {arXiv preprint arXiv:2605.08421},
  year   = {2026}
}