基于表示激活序列学习的无监督模态可迁移视频高亮检测
计算机视觉与模式识别
2024-12-06 v3
摘要
识别原始视频材料的高光时刻对于提高广泛存在于互联网平台上的视频编辑效率至关重要。然而,大量手动标注视频的工作已创建了障碍,阻碍了将监督方法应用于未见视频类别。许多视频缺乏包含高亮检测有价值线索的音频模态,这使得使用多模态策略变得困难。本文提出了一种具有跨模态感知的新模型,用于无监督高亮检测。该模型通过图像-音频配对数据中的自重建任务学习具有视觉-音频层次语义的表示。为实现无监督高亮检测,我们检验该网络的隐式表示,提出了基于 k 点对比学习的表示激活序列学习 (RASL) 模块,以学习重要表示激活。为将视觉模态与音频模态连接,我们使用对称对比学习 (SCL) 模块学习配对的视觉和音频表示。此外,在预训练期间同时进行基于掩码特征向量序列 (FVS) 的重建任务,以用于表示增强。推理期间,跨模态预训练模型可仅给定视觉模态生成具有配对视觉-音频语义的表示。RASL 模块用于输出高亮得分。实验结果表明,所提出的框架在其他最先进方法之上取得优异性能。
引用
@article{arxiv.2403.09401,
title = {Unsupervised Modality-Transferable Video Highlight Detection with Representation Activation Sequence Learning},
author = {Tingtian Li and Zixun Sun and Xinyu Xiao},
journal= {arXiv preprint arXiv:2403.09401},
year = {2024}
}
备注
Accepted by IEEE Transactions on Image Processing, 2024