基于难样本对引导对比学习的视频精彩片段检测视觉-音频表征探查
计算机视觉与模式识别
2022-06-22 v1
摘要
视频精彩片段检测是一项关键且具有挑战性的问题,旨在识别未裁剪视频中的有趣时刻。该任务的关键在于有效的视频表征,其需共同追求两个目标,即跨模态表征学习与细粒度特征判别。本文中,这两个挑战通过不仅丰富表征建模的模态内与跨模态关系,而且以判别性方式塑造特征得以解决。我们提出的方法主要利用模态内编码与跨模态共现编码进行充分表征建模。具体而言,模态内编码通过音频与视觉信号中的模态内关系学习增强模态-wise 特征并抑制无关模态。同时,跨模态共现编码聚焦于共现的模态间关系,并在多模态中有选择地捕获有效信息。从局部上下文抽象出的全局信息进一步增强了多模态表征。此外,我们通过难样本对引导对比学习(HPCL)方案扩大特征嵌入的判别力。进一步采用难样本对采样策略挖掘难样本,以提升 HPCL 中的特征判别性。在两个基准上的大量实验证明了我们所提方法相较于其他最先进方法的有效性与优越性。
引用
@article{arxiv.2206.10157,
title = {Probing Visual-Audio Representation for Video Highlight Detection via Hard-Pairs Guided Contrastive Learning},
author = {Shuaicheng Li and Feng Zhang and Kunlin Yang and Lingbo Liu and Shinan Liu and Jun Hou and Shuai Yi},
journal= {arXiv preprint arXiv:2206.10157},
year = {2022}
}