Unveil:面向多模态文档检索的统一视觉-文本集成与知识蒸馏
计算与语言
2026-05-26 v1 计算机视觉与模式识别
摘要
现实场景中的文档检索因文档格式和模态的多样性而面临重大挑战。传统的基于文本的方法依赖于定制的解析技术,这些技术忽略布局信息且容易出错,而近期免解析的视觉方法在文本丰富的场景中往往难以捕捉细粒度的文本语义。为解决这些局限性,我们提出了一种名为 Unveil 的新型视觉-文本嵌入框架,该框架能有效集成文本与视觉特征,以实现鲁棒的文档表示。通过知识蒸馏,我们将视觉-文本嵌入模型的语义理解能力迁移到纯视觉模型,从而在保持语义保真度的同时实现高效的免解析检索。实验结果表明,我们的视觉-文本嵌入方法超越了现有方法,而知识蒸馏成功弥合了视觉-文本方法与纯视觉方法之间的性能差距,同时提升了检索的准确性和效率。
引用
@article{arxiv.2605.24530,
title = {Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval},
author = {Hao Sun and Yingyan Hou and Jiayan Guo and Bo Wang and Chunyu Yang and Jinsong Ni and Yan Zhang},
journal= {arXiv preprint arXiv:2605.24530},
year = {2026}
}
备注
ACL 2025 Main Conference