利用大语言模型扩展视频摘要预训练
计算机视觉与模式识别
2024-04-05 v1
摘要
长视频内容构成了互联网流量的重要组成部分,使得自动视频摘要成为一个重要的研究问题。然而,现有的视频摘要数据集在规模上存在明显局限,限制了最先进方法在泛化方面的有效性。我们的工作旨在利用具有密集语音-视频对齐的长视频资源以及近期大语言模型(LLMs)在长文本摘要方面的卓越能力,来克服这一局限性。我们引入了一种自动化且可扩展的流水线,利用 LLMs 作为 Oracle 摘要器来生成大规模视频摘要数据集。通过利用生成的数据集,我们分析了现有方法的局限性,并提出了一种能有效解决这些局限性的新视频摘要模型。为了促进该领域的进一步研究,我们的工作还提出了一个新的基准数据集,包含 1200 个长视频,每个视频均带有专业人员标注的高质量摘要。大量实验清楚地表明,我们提出的方法在多个基准上的视频摘要任务中创造了新的 SOTA。
引用
@article{arxiv.2404.03398,
title = {Scaling Up Video Summarization Pretraining with Large Language Models},
author = {Dawit Mureja Argaw and Seunghyun Yoon and Fabian Caba Heilbron and Hanieh Deilamsalehy and Trung Bui and Zhaowen Wang and Franck Dernoncourt and Joon Son Chung},
journal= {arXiv preprint arXiv:2404.03398},
year = {2024}
}
备注
Accepted to CVPR 2024