用于老年人活动识别的扩展-压缩-激励融合网络
计算机视觉与模式识别
2022-04-26 v2 机器学习
摘要
本工作聚焦于老年人活动识别任务,由于老年人活动中存在个体动作与人-物交互,该任务具有挑战性。因此,我们试图通过注意力融合多模态特征,有效聚合来自 RGB 视频和骨架序列的动作与交互的判别信息。近来,一些非线性多模态融合方法利用从压缩-激励网络(SENet)扩展而来的非线性注意力机制被提出。受此启发,我们提出一种新颖的扩展-压缩-激励融合网络(ESE-FN)来有效解决老年人活动识别问题,该网络学习模态和通道维度的扩展-压缩-激励(ESE)注意力,以模态和通道方式注意力融合多模态特征。此外,我们设计了一种新的多模态损失(ML),通过增加对单模态上最小预测损失与融合模态上预测损失之间差异的惩罚,保持单模态特征与融合多模态特征之间的一致性。最后,我们在最大规模的老年人活动数据集即 ETRI-Activity3D(包含 110,000+ 视频和 50+ 类别)上进行实验,证明所提 ESE-FN 相比最先进的方法取得了最佳准确率。此外,更广泛的实验结果表明,所提 ESE-FN 在正常动作识别任务中也与其他方法相当。
引用
@article{arxiv.2112.10992,
title = {Expansion-Squeeze-Excitation Fusion Network for Elderly Activity Recognition},
author = {Xiangbo Shu and Jiawen Yang and Rui Yan and Yan Song},
journal= {arXiv preprint arXiv:2112.10992},
year = {2022}
}