基于伪标签监督的查询式视频摘要
计算机视觉与模式识别
2023-07-06 v1 人工智能
信息检索
摘要
现有用于人工标注的查询式视频摘要的数据集成本高昂因而规模小,限制了有监督深度视频摘要模型的性能。自监督可通过使用 pretext 任务并定义获取带伪标签的额外数据的方法来预训练有监督深度模型,从而应对数据稀疏挑战。本工作中,我们从输入视频引入片段级伪标签,以恰当建模 pretext 任务与目标任务间的关系,以及伪标签与人类定义标签间的隐式关系。伪标签基于现有人类定义的帧级标签生成。为创建更准确的查询依赖视频摘要,提出语义增强器以生成上下文感知的查询表示。此外,我们提出互注意力以帮助捕获视觉与文本模态间的交互信息。使用三个常用视频摘要基准彻底验证所提方法。实验结果表明所提视频摘要算法达到了最先进性能。
引用
@article{arxiv.2307.01945,
title = {Query-based Video Summarization with Pseudo Label Supervision},
author = {Jia-Hong Huang and Luka Murn and Marta Mrak and Marcel Worring},
journal= {arXiv preprint arXiv:2307.01945},
year = {2023}
}
备注
This paper is accepted by IEEE International Conference on Image Processing (ICIP), 2023