双流 LSTM:用于人体动作识别的深度融合框架
计算机视觉与模式识别
2017-04-06 v1
摘要
在本文中,我们处理了从视频序列中进行人体动作识别的问题。受计算机视觉中自动特征学习与深度学习方法所获卓越结果的启发,我们将注意力集中于通过卷积神经网络 (CNN) 学习显著的空间特征,随后利用长短期记忆 (LSTM) 网络映射其时间关系。我们在本文中的贡献是一个深度融合框架,该框架更有效地将来自 CNN 的空间特征与来自 LSTM 模型的时间特征加以利用。我们还广泛评估了它们的优势与不足。我们发现,通过结合这两组特征,全连接特征有效地起到了注意力机制的作用,引导 LSTM 关注卷积特征序列中有趣的部分。与其他 SOTA 方法相比,我们融合方法的意义在于其简单性与有效性。评估结果表明,与单流映射方法相比,这种分层多流融合方法具有更高的性能,使其在三个广泛使用的数据库 UCF11、UCFSports 和 jHMDB 上实现了高准确率,优于当前 SOTA 方法。
引用
@article{arxiv.1704.01194,
title = {Two Stream LSTM: A Deep Fusion Framework for Human Action Recognition},
author = {Harshala Gammulle and Simon Denman and Sridha Sridharan and Clinton Fookes},
journal= {arXiv preprint arXiv:1704.01194},
year = {2017}
}
备注
Published as a conference paper at WACV 2017