面向野生动物长视频的时空事件分割与定位
计算机视觉与模式识别
2021-07-20 v4 机器学习
图像与视频处理
摘要
利用离线训练方案,研究者通过手动标注标签或基于自监督轮次的训练提供全监督或弱监督,解决了事件分割问题。大多数工作考虑的影片时长至多几十分钟。我们提出了一种自监督感知预测框架,能够通过随时间构建物体的稳定表示来实现时间事件分割,并在跨度数天的长视频上进行了演示。该方法看似简单却十分有效。我们依赖于标准深度学习骨干网络计算的高层特征预测。对于预测,我们使用一个 LSTM,并辅以注意力机制,以预测误差通过自监督方式训练。自学习得到的注意力图有效地定位并跟踪每帧中与事件相关的物体。所提方法不需要标签,仅需对视频单次遍历,无需单独的训练集。鉴于缺乏极长视频数据集,我们在经许可收集的 10 天(254 小时)连续野生动物监测数据视频上演示了我们的方法。我们发现该方法对昼夜条件、降雨、锐利阴影和刮风等多种环境条件具有鲁棒性。对于时间定位事件任务,在帧级分割上我们以 20% 假阳性率取得了 80% 召回率;在活动级别上,每 50 分钟一次错误活动检测下我们取得了 80% 活动召回率。我们将向研究界提供该首创的数据集与代码。
引用
@article{arxiv.2005.02463,
title = {Spatio-Temporal Event Segmentation and Localization for Wildlife Extended Videos},
author = {Ramy Mounir and Roman Gula and Jörn Theuerkauf and Sudeep Sarkar},
journal= {arXiv preprint arXiv:2005.02463},
year = {2021}
}