中文

动态声源的有源音视觉分离

计算机视觉与模式识别 2022-07-26 v2 机器学习 声音 音频与语音处理 图像与视频处理

摘要

我们探索针对动态声源的有源音视觉分离,其中具身智能体在3D环境中智能移动,以持续隔离感兴趣物体发出的时变音频流。该智能体听到多个音频源的混合流(例如,在嘈杂派对上多人交谈与乐队演奏音乐)。在有限的时间预算下,它需要利用以自我为中心的音视觉观测在每一步准确提取目标声音。我们提出了一种配备新颖transformer记忆的强化学习智能体,其学习运动策略以控制相机与麦克风来恢复动态目标音频,利用自注意力为当前时间步做出高质量估计,同时改进其过往估计。利用真实世界扫描的Matterport3D环境中高度逼真的声学SoundSpaces仿真,我们展示了我们的模型能够学习高效行为以执行动态音频目标的连续分离。项目:https://vision.cs.utexas.edu/projects/active-av-dynamic-separation/。

关键词

引用

@article{arxiv.2202.00850,
  title  = {Active Audio-Visual Separation of Dynamic Sound Sources},
  author = {Sagnik Majumder and Kristen Grauman},
  journal= {arXiv preprint arXiv:2202.00850},
  year   = {2022}
}

备注

Accepted to ECCV 2022