Information Retrieval · Computer Science
Reproducibility, Replicability, and Insights into Visual Document Retrieval with Late Interaction
Jingfen Qiao, Jia-Huei Ju, Xinyu Ma, Evangelos Kanoulas +1
2025-05-13
Computation and Language · Computer Science
Beyond the Grid: Layout-Informed Multi-Vector Retrieval with Parsed Visual Document Representations
Yibo Yan, Mingdong Ou, Yi Cao, Xin Zou +5
2026-03-03
Computation and Language · Computer Science
A LayoutLMv3-Based Model for Enhanced Relation Extraction in Visually-Rich Documents
Wiam Adnan, Joel Tang, Yassine Bel Khayat Zouggari, Seif Edinne Laatiri +2
2024-04-18
Computation and Language · Computer Science
DocPruner: A Storage-Efficient Framework for Multi-Vector Visual Document Retrieval via Adaptive Patch-Level Embedding Pruning
Yibo Yan, Guangwei Xu, Xin Zou, Shuliang Liu +2
2025-09-30
Information Retrieval · Computer Science
SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Models
Thong Nguyen, Yibin Lei, Jia-Huei Ju, Andrew Yates
2025-09-22
Information Retrieval · Computer Science
ColPali: Efficient Document Retrieval with Vision Language Models
Manuel Faysse, Hugues Sibille, Tony Wu, Bilel Omrani +3
2025-03-03
Computation and Language · Computer Science
LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding
Yang Xu, Yiheng Xu, Tengchao Lv, Lei Cui +8
2022-01-11
Information Retrieval · Computer Science
Attention Grounded Enhancement for Visual Document Retrieval
Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu +3
2026-05-12
Computer Vision and Pattern Recognition · Computer Science
Towards Implicit Aggregation: Robust Image Representation for Place Recognition in the Transformer Era
Feng Lu, Tong Jin, Canming Ye, Yunpeng Liu +2
2026-01-19
Computer Vision and Pattern Recognition · Computer Science
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
Yibo Yan, Mingdong Ou, Yi Cao, Jiahao Huo +4
2026-04-14
Information Retrieval · Computer Science
ModernVBERT: Towards Smaller Visual Document Retrievers
Paul Teiletche, Quentin Macé, Max Conti, Antonio Loison +3
2025-12-17
Computation and Language · Computer Science
LAD-RAG: Layout-aware Dynamic RAG for Visually-Rich Document Understanding
Zhivar Sourati, Zheng Wang, Marianne Menglin Liu, Yazhe Hu +7
2026-03-03
Computer Vision and Pattern Recognition · Computer Science
Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding
Peter El Hachem, Ahmed Nassar, A. Said Gurbuz, Christoph Auer +1
2026-05-20
Computation and Language · Computer Science
Enhancing Visually-Rich Document Understanding via Layout Structure Modeling
Qiwei Li, Zuchao Li, Xiantao Cai, Bo Du +1
2023-08-16
Computer Vision and Pattern Recognition · Computer Science
Evo-Retriever: LLM-Guided Curriculum Evolution with Viewpoint-Pathway Collaboration for Multimodal Document Retrieval
Weiqing Li, Jinyue Guo, Yaqi Wang, Haiyang Xiao +3
2026-03-18
Computer Vision and Pattern Recognition · Computer Science
TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment
Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du +3
2026-03-25
Computer Vision and Pattern Recognition · Computer Science
VSR: A Unified Framework for Document Layout Analysis combining Vision, Semantics and Relations
Peng Zhang, Can Li, Liang Qiao, Zhanzhan Cheng +3
2021-05-14
Computer Vision and Pattern Recognition · Computer Science
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
Yi-Fan Zhang, Qingsong Wen, Chaoyou Fu, Xue Wang +3
2024-06-17
Information Retrieval · Computer Science
Nemotron ColEmbed V2: Top-Performing Late Interaction Embedding Models for Visual Document Retrieval
Gabriel de Souza P. Moreira, Ronay Ak, Mengyao Xu, Oliver Holworthy +8
2026-04-02
Computation and Language · Computer Science
Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval
Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou +11
2026-03-24
Computer Vision and Pattern Recognition · Computer Science
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
Fengbin Zhu, Zijing Cai, Yuzhe Wang, Pengyang Shao +4
2026-03-17
Computation and Language · Computer Science
DocLLM: A layout-aware generative language model for multimodal document understanding
Dongsheng Wang, Natraj Raman, Mathieu Sibue, Zhiqiang Ma +5
2024-01-03