以自我为中心的音视对象定位
计算机视觉与模式识别
2023-03-24 v1 多媒体
声音
音频与语音处理
摘要
人类通过在第一人称视角下统一声音与视觉自然感知周围场景。同样,机器通过学习来自以自我为中心视角下的多感官输入而向人类智能迈进。在本文中,我们探索了具有挑战性的以自我为中心的音视对象定位任务,并观察到:1)自我运动(egomotion)普遍存在于第一人称录制中,即便在很短的时长内也是如此;2)当我们佩戴者转移注意力时,可能产生视场外的声音分量。针对第一个问题,我们提出一个几何感知的时间聚合模块来显式处理自我运动。通过估计时间几何变换并利用其更新视觉表征,自我运动的影响得以缓解。此外,我们提出一个级联特征增强模块来解决第二个问题。它通过解耦视觉指示的音频表征来提升跨模态定位的鲁棒性。在训练过程中,我们利用自然可用的音视时间同步作为“免费”的自监督以避免昂贵的标注。我们还标注并创建了 Epic Sounding Object 数据集用于评估。大量实验表明,我们的方法在以自我为中心的视频中取得了最先进的(SOTA)定位性能,并可泛化到多样的音视场景。
引用
@article{arxiv.2303.13471,
title = {Egocentric Audio-Visual Object Localization},
author = {Chao Huang and Yapeng Tian and Anurag Kumar and Chenliang Xu},
journal= {arXiv preprint arXiv:2303.13471},
year = {2023}
}
备注
Accepted by CVPR 2023