中文

面向自然语言驱动文档图像检索:新数据集与基准

计算机视觉与模式识别 2025-12-24 v1 计算与语言 信息检索

摘要

文档图像检索(DIR)旨在根据给定查询检索文档图像。现有DIR方法主要基于图像查询,在同一较粗语义类别内检索文档,例如报纸或收据。然而,这些方法在实际场景中难以有效检索文本查询(通常具有细粒度语义)的文档图像。为弥合这一差距,本文引入了新的自然语言驱动文档图像检索(NL-DIR)基准及相应的评估指标。本文中,自然语言描述作为DIR任务的语义丰富查询。NL-DIR数据集包含41K张真实文档图像,每张图像配有五个高质量、细粒度语义查询,通过大型语言模型生成并通过人工验证。我们对现有主流对比式视觉语言模型和无OCR视觉文档理解(VDU)模型进行零样态和微调评估。进一步研究了一种用于性能提升的两阶段检索方法,同时实现了时间和空间效率。我们希望提出的NL-DIR基准能带来新的机遇并促进VDU社区的研究。数据集和代码将在huggingface.co/datasets/nianbing/NL-DIR上公开。

关键词

引用

@article{arxiv.2512.20174,
  title  = {Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark},
  author = {Hao Guo and Xugong Qin and Jun Jie Ou Yang and Peng Zhang and Gangyan Zeng and Yubo Li and Hailun Lin},
  journal= {arXiv preprint arXiv:2512.20174},
  year   = {2025}
}

备注

CVPR 2025