用于视频活动识别的类人关系模型
计算机视觉与模式识别
2022-01-12 v2
摘要
深度神经网络在多数类别上的视频活动识别表现令人印象深刻。然而,它仍不及人类水平,尤其是对于难以区分的活动。人类通过识别显式识别出的物体与部位之间关键的时空关系来区分这些复杂活动,例如一个物体进入容器的孔口。深度神经网络可能难以有效学习此类关键关系。因此我们提出一种更类人的活动识别方法,该方法将视频按连续时间阶段进行解读,并提取这些阶段中物体与手之间的特定关系。从这些提取出的关系中学习随机森林分类器。我们将该方法应用于 something-something 数据集的一个具有挑战性的子集,并在具有挑战性的活动上相比神经网络基线取得了更鲁棒的性能。
引用
@article{arxiv.2107.05319,
title = {Human-like Relational Models for Activity Recognition in Video},
author = {Joseph Chrol-Cannon and Andrew Gilbert and Ranko Lazic and Adithya Madhusoodanan and Frank Guerin},
journal= {arXiv preprint arXiv:2107.05319},
year = {2022}
}