分离不可见声音:面向通用视听场景感知声音分离
计算机视觉与模式识别
2023-10-19 v1 声音
音频与语音处理
摘要
视听声音分离领域假设视频中源可见,但这排除了相机视野之外的不可见声音。现有方法难以处理此类缺乏可见线索的声音。本文提出一种新颖的“视听场景感知分离”(AVSA-Sep) 框架。它包含一个用于可见与不可见声音的语义解析器,以及一个用于场景知情分离的分离器。AVSA-Sep 成功分离了两类声音,且联合训练与跨模态对齐提升了有效性。
引用
@article{arxiv.2310.11713,
title = {Separating Invisible Sounds Toward Universal Audiovisual Scene-Aware Sound Separation},
author = {Yiyang Su and Ali Vosoughi and Shijian Deng and Yapeng Tian and Chenliang Xu},
journal= {arXiv preprint arXiv:2310.11713},
year = {2023}
}
备注
Accepted at ICCV 2023 - AV4D, 4 figures, 3 tables