基于视觉语言模型的多模态演示文稿摘要化:关于模态性与结构影响的研究
计算机视觉与模式识别
2025-04-15 v1 计算与语言
摘要
视觉语言模型 (Vision-Language Models, VLMs) 可以以多种格式处理视觉和文本信息:文本、图像、交错的文本和图像,甚至是多个小时的视频。本文我们对使用 VLMs 进行多模态演示文稿自动摘要化进行细粒度的定量和质性分析,研究各种表示形式作为输入。通过这些实验,我们提出了在不同的输入长度预算下,使用 VLMs 从文本丰富的多模态文档生成摘要的经济有效策略。我们展示,从视频流中提取的幻灯片可以作为输入使用,而相对于原始视频,这种做法更有优势;此外,来自交错幻灯片和 transcript 的结构化表示提供了最佳性能。最后,我们反思并评论了多模态演示文稿中跨模态交互的本质,并分享了改进 VLMs 理解此类文档能力的建议。
引用
@article{arxiv.2504.10049,
title = {Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure},
author = {Théo Gigant and Camille Guinaudeau and Frédéric Dufaux},
journal= {arXiv preprint arXiv:2504.10049},
year = {2025}
}