同步视频叙事:基于结构化情节生成视频旁白
多媒体
2024-12-31 v2
摘要
视频叙事是一种以视频及其伴随旁白吸引观众的互动性多媒体内容,其中关键挑战在于为录制的视觉场景创建旁白。以往的密集视频描述和视频故事生成研究取得了一些进展。然而,在实际应用中,我们通常需要针对持续进行的视觉场景生成同步旁白。本文引入了名为同步视频叙事的新任务,旨在为视频生成同步且信息丰富的旁白。这些旁白应与每个视频片段相关联,与视觉内容相吻合,融合相关知识,并根据片段时长具有恰当的字数。具体而言,结构化情节有助于引导生成过程,确保连贯性和完整性。为支持该任务的探索,本文引入了包含丰富标注的新基准数据集 E-SyncVidStory。由于现有多模态大语言模型在单次或少量样本设置下无法有效解决该任务,我们提出了名为 VideoNarrator 的框架,可为输入视频生成情节,同时在生成或预定义情节的指导下生成旁白。我们进一步引入了一组评估指标,以全面评估生成效果。自动评估和人类评估均验证了我们方法的有效性。我们的数据集、代码和评估将予以发布。
引用
@article{arxiv.2405.14040,
title = {Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline},
author = {Dingyi Yang and Chunru Zhan and Ziheng Wang and Biao Wang and Tiezheng Ge and Bo Zheng and Qin Jin},
journal= {arXiv preprint arXiv:2405.14040},
year = {2024}
}
备注
15 pages, 13 figures