TeaserGen:为长纪录片生成预告片
计算机视觉与模式识别
2024-11-12 v2 人工智能
摘要
预告片是娱乐、商业和教育领域推广内容的有效工具。然而,为长视频制作有效的预告片具有挑战性,因为它需要对输入视频进行长程多模态建模,同时需要保持输出预告片的视听对齐、管理场景变化并保持事实准确性。由于缺乏公开可用的数据集,这一研究方向进展受阻。本文提出了DocumentaryNet,这是一个包含1269部纪录片及其预告片的集合,具有视频、语音、音乐、音效和旁白等多模态数据流。借助DocumentaryNet,我们提出了一种新的两阶段系统,用于从长纪录片生成预告片。所提出的TeaserGen系统首先使用预训练的大语言模型从纪录片的转录旁白中生成预告片旁白,然后通过语言-视觉模型选择最相关的视觉内容来伴随生成的旁白。对于旁白-视频匹配,我们探索了两种方法:一种使用预训练对比语言-视觉模型的基于预训练的方法,以及一种学习旁白与视觉之间映射的深度序列模型。我们的实验结果表明,基于预训练的方法在识别相关视觉内容方面比直接训练的深度自回归模型更有效。
引用
@article{arxiv.2410.05586,
title = {TeaserGen: Generating Teasers for Long Documentaries},
author = {Weihan Xu and Paul Pu Liang and Haven Kim and Julian McAuley and Taylor Berg-Kirkpatrick and Hao-Wen Dong},
journal= {arXiv preprint arXiv:2410.05586},
year = {2024}
}