中文

用于分类与定位未见动作的对象先验

计算机视觉与模式识别 2021-04-13 v1

摘要

本研究致力于视频中人体动作的分类与定位,且无需任何带标签的视频训练样本。现有工作依赖将全局属性或对象信息从已见动作迁移至未见动作视频,而我们旨在仅基于图像级对象信息对视频中的未见动作进行分类及时空定位。我们提出三种空间对象先验,其编码了局部人体与对象检测器及其空间关系。在此基础上,我们引入三种语义对象先验,通过词嵌入扩展语义匹配,并采用三个简单函数处理语义歧义、对象区分与对象命名。一种视频嵌入融合了空间与语义对象先验。它使我们能够引入一种新的视频检索任务:基于用户指定的对象、空间关系与对象大小,在视频集合中检索动作管。在五个动作数据集上的实验评估显示了空间与语义对象先验对未见动作的重要性。我们发现人体与对象具有偏好的空间关系,有利于未见动作定位,而使用多种语言与简单对象过滤可直接改进语义匹配,从而在未见动作分类与定位上均取得最先进(SOTA)结果。

关键词

引用

@article{arxiv.2104.04715,
  title  = {Object Priors for Classifying and Localizing Unseen Actions},
  author = {Pascal Mettes and William Thong and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2104.04715},
  year   = {2021}
}

备注

Accepted to IJCV