音频对于识别第一人称视角物体交互有多大作用?
计算机视觉与模式识别
2019-06-04 v1 人工智能
摘要
声音是我们日常与物体交互的重要信息来源。例如,相当多的人仅通过听觉就能辨别正在倒出的水的温度。然而,仅有少数工作探索了将音频与视觉结合或作为单一模态用于物体交互分类。在这项初步工作中,我们提出了一种用于第一人称动作识别的音频模型,并探究其在问题各子任务(名词、动词和动作分类)上的效用。在标准基准上,相对于基于视觉的 SOTA 系统,我们的模型使用相对更轻量的架构,在动词分类方面取得了具有竞争力的结果(准确率 34.26%)。
引用
@article{arxiv.1906.00634,
title = {How Much Does Audio Matter to Recognize Egocentric Object Interactions?},
author = {Alejandro Cartas and Jordi Luque and Petia Radeva and Carlos Segura and Mariella Dimiccoli},
journal= {arXiv preprint arXiv:1906.00634},
year = {2019}
}
备注
Accepted for presentation at EPIC@CVPR2019 workshop