如何最佳检索幻灯片?多模态、标题基和混合检索技术的比较研究
计算与语言
2025-09-19 v1
摘要
幻灯片组作为连接演示稿和书面文档的数字报告,广泛用于学术和企业场景,因其多模态特性(融合文本、图像和图表)而面临检索增强生成系统的检索质量直接影响下游性能的挑战。传统幻灯片检索方法常对不同模态进行独立索引,易增加复杂度且丢失上下文信息。本文探讨了多种有效幻灯片检索方法,包括视觉晚期交互嵌入模型如 ColPali、视觉重排器,以及结合稠密检索与 BM25 的混合检索技术,进一步增强后者通过文本重排器和 Reciprocal Rank Fusion 等融合方法。我们还评估了基于视觉语言模型的标题生成管道,结果显示其在显著降低嵌入存储需求方面显著优于视觉晚期交互技术,同时保持相当的检索性能。我们的分析延伸至实际考量,评估了这些方法的运行时性能和存储需求,以及检索效果,从而为构建高效稳健的幻灯片检索系统提供了实用指导。
引用
@article{arxiv.2509.15211,
title = {What's the Best Way to Retrieve Slides? A Comparative Study of Multimodal, Caption-Based, and Hybrid Retrieval Techniques},
author = {Petros Stylianos Giouroukis and Dimitris Dimitriadis and Dimitrios Papadopoulos and Zhenwen Shao and Grigorios Tsoumakas},
journal= {arXiv preprint arXiv:2509.15211},
year = {2025}
}