中文

未裁剪动作预期

计算机视觉与模式识别 2022-02-10 v1

摘要

以自我为中心的视频动作预期包括从第一视角视频中预测相机佩戴者将执行的未来动作。尽管该任务近来引起了研究界的关注,当前方法假设输入视频是“裁剪过的”,即短视频序列在动作开始前固定时间采样。我们认为,尽管该领域近期取得了进展,裁剪动作预期在真实场景中的适用性有限,因为需要处理“未裁剪”的视频输入,且无法假设动作开始的精确时刻在测试时是已知的。为克服这些限制,我们提出了一种未裁剪动作预期任务,该任务类似于时间动作检测,假设测试时输入视频未裁剪,同时仍要求在动作实际发生前做出预测。我们为应对这一新任务的方法设计了评估流程,并在EPIC-KITCHENS-100数据集上比较了若干基线。实验表明,当前为裁剪动作预期设计的模型性能非常有限,需要更多针对该任务的研究。

关键词

引用

@article{arxiv.2202.04132,
  title  = {Untrimmed Action Anticipation},
  author = {Ivan Rodin and Antonino Furnari and Dimitrios Mavroeidis and Giovanni Maria Farinella},
  journal= {arXiv preprint arXiv:2202.04132},
  year   = {2022}
}