建模长时交互以增强动作识别
计算机视觉与模式识别
2021-04-26 v1
摘要
在本文中,我们提出一种理解 egocentric 视频中动作的新方法,该方法在帧级和时间级利用物体交互的语义。在帧级,我们使用基于区域的方法,以大致对应用户手部的主区域和一组可能对应交互物体的次区域作为输入,并通过 CNN 公式化计算动作分数。该信息随后被送入分层长短期记忆网络(HLSTM),以捕获镜头内和镜头间动作的时间依赖关系。消融研究充分验证了所提出的方法,特别表明 HLSTM 架构的两个层级均有助于性能提升。此外,定量比较表明,所提出的方法在标准基准上就动作识别而言优于 SOTA,且无需依赖运动信息。
引用
@article{arxiv.2104.11520,
title = {Modeling long-term interactions to enhance action recognition},
author = {Alejandro Cartas and Petia Radeva and Mariella Dimiccoli},
journal= {arXiv preprint arXiv:2104.11520},
year = {2021}
}
备注
Accepted to the 25th International Conference on Pattern Recognition (ICPR), 2021