面向未见动作识别的通用表示
计算机视觉与模式识别
2018-03-23 v1 人工智能
机器学习
多媒体
摘要
未见动作识别(UAR)旨在无需训练样本的情况下识别新的动作类别。以往的方法侧重于数据集内部的已知/未知划分,而本文提出了一种利用大规模训练源实现通用表示(UR)的流程,该表示能够泛化到更现实的跨数据集UAR(CD-UAR)场景。我们首先将UAR视为广义多实例学习(GMIL)问题,并使用分布核从大规模ActivityNet数据集中发现“构建块”。关键的视觉和语义成分被保留在一个共享空间中,以实现能够高效泛化到新数据集的UR。预测的UR样本可以通过简单的语义自适应得到改进,然后在测试期间直接使用UR识别未见动作。无需进一步训练,大量实验表明在UCF101和HMDB51基准上取得了显著改进。
引用
@article{arxiv.1803.08460,
title = {Towards Universal Representation for Unseen Action Recognition},
author = {Yi Zhu and Yang Long and Yu Guan and Shawn Newsam and Ling Shao},
journal= {arXiv preprint arXiv:1803.08460},
year = {2018}
}
备注
Accepted at CVPR 2018