用于动作识别的无监督运动表示增强网络
计算机视觉与模式识别
2021-03-08 v1
摘要
学习相邻帧之间可靠的运动表示(如光流)已被证明对视频理解有很大促进作用。然而,TV-L1方法作为一种有效的光流求解器,在缓存提取的光流时耗时且存储开销大。为弥补这一不足,我们提出UF-TSN,一种由嵌入式轻量级无监督光流估计器增强的新型端到端动作识别方法。UF-TSN以由粗到精的方式从相邻帧估计运动线索,并通过提取特征金字塔并根据上一层的估计光流将一帧扭曲到另一帧,从而聚焦于每一层的小位移。由于动作数据集缺乏标注的运动,我们利用多尺度光度一致性和边缘感知平滑性对光流预测进行约束。与最先进的无监督运动表示学习方法相比,我们的模型在保持效率的同时取得了更好的精度,且与一些有监督或更复杂的方案具有竞争力。
引用
@article{arxiv.2103.03465,
title = {Unsupervised Motion Representation Enhanced Network for Action Recognition},
author = {Xiaohang Yang and Lingtong Kong and Jie Yang},
journal= {arXiv preprint arXiv:2103.03465},
year = {2021}
}
备注
Accepted by ICASSP 2021