中文

分离不可见声音:面向通用视听场景感知声音分离

计算机视觉与模式识别 2023-10-19 v1 声音 音频与语音处理

摘要

视听声音分离领域假设视频中源可见,但这排除了相机视野之外的不可见声音。现有方法难以处理此类缺乏可见线索的声音。本文提出一种新颖的“视听场景感知分离”(AVSA-Sep) 框架。它包含一个用于可见与不可见声音的语义解析器,以及一个用于场景知情分离的分离器。AVSA-Sep 成功分离了两类声音,且联合训练与跨模态对齐提升了有效性。

关键词

引用

@article{arxiv.2310.11713,
  title  = {Separating Invisible Sounds Toward Universal Audiovisual Scene-Aware Sound Separation},
  author = {Yiyang Su and Ali Vosoughi and Shijian Deng and Yapeng Tian and Chenliang Xu},
  journal= {arXiv preprint arXiv:2310.11713},
  year   = {2023}
}

备注

Accepted at ICCV 2023 - AV4D, 4 figures, 3 tables