中文

利用概率自动机推断动作的时间组合

计算机视觉与模式识别 2020-04-29 v1

摘要

本文提出一种识别视频中原子动作时间组合的框架。具体而言,我们提议将动作的时间组合表达为语义正则表达式,并推导出一种利用概率自动机的推断框架,以在输入视频特征上将这些表达式满足的复杂动作识别出来。我们的方法与现有工作不同,后者或将长程复杂活动预测为原子动作的无序集合,或使用自然语言句子检索视频。相反,所提方法仅使用预训练的动作分类器即可识别复杂的细粒度活动,无需任何额外数据、标注或神经网络训练。为评估方法的潜力,我们在合成数据集及具有挑战性的真实动作识别数据集(如MultiTHUMOS和Charades)上进行了实验。我们得出结论:所提方法可将最先进的原语动作分类器扩展到远为复杂的活动,且性能退化不大。

关键词

引用

@article{arxiv.2004.13217,
  title  = {Inferring Temporal Compositions of Actions Using Probabilistic Automata},
  author = {Rodrigo Santa Cruz and Anoop Cherian and Basura Fernando and Dylan Campbell and Stephen Gould},
  journal= {arXiv preprint arXiv:2004.13217},
  year   = {2020}
}

备注

Accepted in Workshop on Compositionality in Computer Vision at CVPR, 2020