考虑视频多样性的基于文本语义匹配的语言引导自监督视频摘要
计算机视觉与模式识别
2024-08-21 v2
摘要
当前的视频摘要方法严重依赖监督计算机视觉技术,这需要耗时且主观的人工标注。为了克服这些限制,我们研究了自监督视频摘要。受大语言模型(LLM)成功的启发,我们探索了将视频摘要任务转化为自然语言处理(NLP)任务的可行性。通过利用 LLM 在上下文理解方面的优势,我们旨在提升自监督视频摘要的有效性。我们的方法首先为单个视频帧生成字幕,然后由 LLM 将其合成为文本摘要。随后,我们测量字幕与文本摘要之间的语义距离。值得注意的是,我们提出了一种新的损失函数,根据视频的多样性来优化我们的模型。最后,通过选择字幕与文本摘要相似的视频帧,可以生成摘要视频。我们的方法在 SumMe 数据集上的秩相关系数达到了 SOTA 性能。此外,我们的方法具有能够实现个性化摘要的新颖特性。
引用
@article{arxiv.2405.08890,
title = {Language-Guided Self-Supervised Video Summarization Using Text Semantic Matching Considering the Diversity of the Video},
author = {Tomoya Sugihara and Shuntaro Masuda and Ling Xiao and Toshihiko Yamasaki},
journal= {arXiv preprint arXiv:2405.08890},
year = {2024}
}