视频与文本集成:多模态摘要生成与评估的平衡方法
计算与语言
2025-11-03 v2 计算机视觉与模式识别
摘要
视觉语言模型 (VLM) 在总结复杂多模态输入(如整集电视剧)时,常常难以平衡视觉与文本信息。本文提出一种零样本视频到文本摘要方法,通过构建剧本表示将关键视频片段、对话和人物信息统一整合。不同于以往方法,本文在零样本条件下同时生成剧本并命名人物,仅依据音频、视频和转录文本输入。我们指出现有摘要指标可能无法评估摘要中的多模态内容。为此,我们引入 MFactSum 一种基于视觉和文本两种模态的评估指标。使用 MFactSum,对我们在 SummScreen3D 数据集上的剧本摘要进行评估,显示优于如 Gemini 1.5 等最新视觉语言模型,既生成的摘要包含约 20% 更多相关视觉信息,又仅需 75% 的视频输入。
引用
@article{arxiv.2505.06594,
title = {Integrating Video and Text: A Balanced Approach to Multimodal Summary Generation and Evaluation},
author = {Galann Pennec and Zhengyuan Liu and Nicholas Asher and Philippe Muller and Nancy F. Chen},
journal= {arXiv preprint arXiv:2505.06594},
year = {2025}
}