中文

从酒会倾听:多模态语音分离

音频与语音处理 2025-01-06 v1 声音 信号处理

摘要

本文旨在利用多种模态信息的组合,在多说话者和噪声环境中实现语音分离与增强。先前的研究在依赖同步嘴型或面部身份等时序或静态视觉证据时表现良好。本文提出一种统一框架,基于同步或非同步线索进行多模态语音分离与增强。为此,我们作出以下贡献:(i)设计一种专为融合不同模态信息以解决原始波形域语音分离任务而量身定制的现代 Transformer 架构;(ii)提出仅依据句子文本内容或结合视觉信息进行条件化的方法;(iii)展示模型对音频-视觉同步偏移的鲁棒性;(iv)在 established benchmark 数据集 LRS2 和 LRS3 上取得 state-of-the-art 性能。

关键词

引用

@article{arxiv.2501.01518,
  title  = {Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation},
  author = {Akam Rahimi and Triantafyllos Afouras and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2501.01518},
  year   = {2025}
}