无表观信息的行为识别是否可能?
计算机视觉与模式识别
2022-07-14 v1 机器学习
摘要
直觉可能暗示运动与动态信息是基于视频的行为识别的关键。相反,有证据表明,最先进的深度学习视频理解架构偏向于单帧中可用的静态信息。目前,缺乏一种方法来隔离视频中动态信息的影响,也缺少相应的数据集。这种缺失使得我们难以理解当代架构在多大程度上利用了动态与静态信息。对此,我们提出了一个用于行为识别的新型无表观数据集(AFD)。AFD不包含单帧中与行为识别相关的静态信息。对该任务的建模必须考虑动态,因为行为仅通过时间维度的考察才显现出来。我们在AFD及其相关的RGB视频上评估了11种当代行为识别架构。结果显示,所有架构在AFD上的性能相较RGB均有显著下降。我们还对人类进行了一项补充研究,表明人类在AFD和RGB上的识别准确率非常接近,且远优于所评估架构在AFD上的表现。我们的结果促使我们提出一种在当代设计中复兴显式光流恢复的新架构,以在AFD和RGB上取得最佳性能。
引用
@article{arxiv.2207.06261,
title = {Is Appearance Free Action Recognition Possible?},
author = {Filip Ilic and Thomas Pock and Richard P. Wildes},
journal= {arXiv preprint arXiv:2207.06261},
year = {2022}
}