基于音视觉特征的第一人称多模态活动识别
计算机视觉与模式识别
2020-05-01 v3
摘要
第一人称视频中的自我中心活动识别在诸如生活记录、摘要生成、辅助生活和活动追踪等多种应用中日益重要。该任务的现有方法基于使用为每个特征预先确定的权重对各种传感器信息进行解释。在本工作中,我们提出了一种基于将音视觉特征与多核学习(MKL)和多核提升(MKBoost)相结合的新框架来解决自我中心活动识别问题。为此,首先从视频中提取网格光流、虚拟惯性特征、对数协方差、立方体特征。音频信号使用基于帧级特征的高斯混合建模并随后进行最大后验自适应所获得的“超向量”来表征。然后,所提取的多模态特征由 MKL 分类器自适应融合,其中特征与核的选择/加权以及识别任务一同执行。所提框架在多个自我中心数据集上进行了评估。结果表明,使用多模态特征结合 MKL 优于现有方法。
引用
@article{arxiv.1807.00612,
title = {Multi-modal Egocentric Activity Recognition using Audio-Visual Features},
author = {Mehmet Ali Arabacı and Fatih Özkan and Elif Surer and Peter Jančovič and Alptekin Temizel},
journal= {arXiv preprint arXiv:1807.00612},
year = {2020}
}