中文

一种用于足球视频中动作定位的上下文感知损失函数

计算机视觉与模式识别 2020-03-31 v3 机器学习 图像与视频处理

摘要

在视频理解中,动作定位(action spotting)指对带有单时间戳标注的人为事件进行时间上的定位。本文提出一种新颖的损失函数,其特别考虑了每个动作周围自然存在的时序上下文,而非聚焦于被标注的单一帧进行定位。我们在大型足球视频数据集 SoccerNet 上对我们的损失进行基准测试,相较基线取得了 12.8% 的提升。我们展示了该损失在 ActivityNet 上用于通用活动提议与检测的泛化能力,通过定位每个活动的起始与结束时刻。此外,我们提供了扩展的消融研究并展示了足球视频中动作定位的挑战性案例。最后,我们定性地说明了我们的损失如何引发对动作的精确时序理解,并展示此类语义知识如何用于自动集锦生成。

关键词

引用

@article{arxiv.1912.01326,
  title  = {A Context-Aware Loss Function for Action Spotting in Soccer Videos},
  author = {Anthony Cioppa and Adrien Deliège and Silvio Giancola and Bernard Ghanem and Marc Van Droogenbroeck and Rikke Gade and Thomas B. Moeslund},
  journal= {arXiv preprint arXiv:1912.01326},
  year   = {2020}
}

备注

Accepted for CVPR2020 main conference. This document contains 8 pages + references + supplementary material