中文

LAVSS:位置引导的视听空间音频分离

声音 2023-11-01 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

现有机器学习研究在单声道视听分离(MAVS)上已取得可喜成果。然而,多数MAVS方法仅考虑声源是什么,而不考虑其位于何处。这在VR/AR场景中会成为问题,因为听者需能区分位于不同方向的相似音频源。为应对此局限,我们将MAVS推广至空间音频分离,并提出LAVSS:一种位置引导的视听空间音频分离器。LAVSS受空间音频与视觉位置间相关性的启发。我们引入双耳音频所携带的相位差作为空间线索,并利用发声对象的位置表示作为额外模态引导。我们还采用多级跨模态注意力以执行音频特征与视觉-位置协作。此外,我们采用预训练的单声道分离器,将丰富单声道声音中的知识迁移以提升空间音频分离,这利用了单声道与双耳通道间的相关性。在FAIR-Play数据集上的实验证明了所提LAVSS相对于现有视听分离基准的优越性。项目主页:https://yyx666660.github.io/LAVSS/。

关键词

引用

@article{arxiv.2310.20446,
  title  = {LAVSS: Location-Guided Audio-Visual Spatial Audio Separation},
  author = {Yuxin Ye and Wenming Yang and Yapeng Tian},
  journal= {arXiv preprint arXiv:2310.20446},
  year   = {2023}
}

备注

Accepted by WACV2024