中文

看见并听见以自我为中心的日常动作:我们能学到多少?

计算机视觉与模式识别 2019-10-16 v1 机器学习 音频与语音处理

摘要

我们与世界的互动本质上是一种多模态体验。然而,对人-物交互的理解历来聚焦于单一模态。具体而言,仅有少量工作考虑为此整合视觉与音频模态。本文提出一种依赖音频与视觉信息的厨房环境下以自我为中心动作识别的多模态方法。我们的模型将稀疏时间采样策略与音频、空间及时间流的后期融合相结合。在EPIC-Kitchens数据集上的实验结果表明,多模态整合优于单模态方法,尤其我们在动词分类上取得了比当前最优(SOTA)高5.18%的提升。

关键词

引用

@article{arxiv.1910.06693,
  title  = {Seeing and Hearing Egocentric Actions: How Much Can We Learn?},
  author = {Alejandro Cartas and Jordi Luque and Petia Radeva and Carlos Segura and Mariella Dimiccoli},
  journal= {arXiv preprint arXiv:1910.06693},
  year   = {2019}
}

备注

Accepted for the Fifth International Workshop on Egocentric Perception, Interaction and Computing (EPIC) at the International Conference on Computer Vision (ICCV) 2019