少即是多:从视频时长学习高光检测
计算机视觉与模式识别
2019-03-05 v1
摘要
高光检测有望极大简化视频浏览,但现有方法往往面临高昂的监督需求,即人类观看者必须手动识别训练视频中的高光片段。我们提出了一种可扩展的无监督解决方案,利用视频时长作为隐式监督信号。我们的核心洞察是,来自较短用户生成视频的视频片段比来自较长视频的片段更有可能是高光,因为用户在拍摄较短视频时往往对内容更具选择性。基于此洞察,我们引入了一种新颖的排序框架,该框架偏好来自较短视频的片段,同时妥善处理(无标签)训练数据中固有的噪声。我们使用它训练了一个高光检测器,使用了 1000 万条带标签的 Instagram 视频。在两个具有挑战性的公开视频高光检测基准上的实验表明,我们的方法大幅提升了无监督高光检测的 SOTA。
引用
@article{arxiv.1903.00859,
title = {Less is More: Learning Highlight Detection from Video Duration},
author = {Bo Xiong and Yannis Kalantidis and Deepti Ghadiyaram and Kristen Grauman},
journal= {arXiv preprint arXiv:1903.00859},
year = {2019}
}
备注
To appear in CVPR 2019