基于 LiveFood 基准探索域增量视频精彩片段检测
计算机视觉与模式识别
2023-12-13 v4
摘要
视频精彩片段检测(VHD)是计算机视觉中的活跃研究领域,旨在给定原始视频输入时定位最吸引用户的片段。然而,大多数 VHD 方法基于封闭世界假设,即事先定义固定数量的精彩类别且所有训练数据预先可用。因此,现有方法在精彩域与训练数据增长时扩展性差。为解决上述问题,我们提出一种名为全局原型编码(GPE)的新颖视频精彩片段检测方法,通过参数化原型进行增量学习以适应新域。为推进这一新研究方向,我们收集了一个精细标注的数据集 LiveFood,包含超过 5,100 个美食直播视频,涵盖四个域:食材、烹饪、摆盘与进食。据我们所知,这是首个在增量学习设定下探索视频精彩片段检测的工作,为将 VHD 应用于 concerned 精彩域与训练数据随时间增长的实际场景开辟了新天地。我们通过大量实验证明了 GPE 的有效性。值得注意的是,GPE 在 LiveFood 上超越流行的域增量学习方法,在所有域上取得显著的 mAP 提升。在经典数据集上,GPE 也取得与以往方法相当的性能。代码见:https://github.com/ForeverPs/IncrementalVHD_GPE。
引用
@article{arxiv.2209.05166,
title = {Exploring Domain Incremental Video Highlights Detection with the LiveFood Benchmark},
author = {Sen Pei and Shixiong Xu and Xiaojie Jin},
journal= {arXiv preprint arXiv:2209.05166},
year = {2023}
}
备注
AAAI 2024