基于瓶颈迭代网络的音视频语音分离
声音
2025-07-11 v1 多媒体
音频与语音处理
摘要
来自非听觉线索的信息集成可以显著提高语音分离模型的性能。通常,这类模型使用深层特定模态的网络来获取单模态特征,风险在于要么过于昂贵,要么轻便但缺乏容量。在本工作中,我们提出了一种称为瓶颈迭代网络(Bottleneck Iterative Network, BIN)的迭代表示细化方法,该方法反复经过轻量级融合块,同时通过融合标记对融合表示进行瓶颈化。这有助于提高模型的容量,同时避免主要增加模型大小,并在模型性能和训练成本之间进行权衡。我们在具有挑战性的噪声音视频语音分离任务上测试了BIN,表明该方法在NTCD-TIMIT和LRS3+WHAM!数据集上始终以相对于SI-SDRi的性能优于最先进的基准模型,同时在几乎所有设置下实现了超过50%的训练和GPU推理时间减少。
引用
@article{arxiv.2507.07270,
title = {Audio-Visual Speech Separation via Bottleneck Iterative Network},
author = {Sidong Zhang and Shiv Shankar and Trang Nguyen and Andrea Fanelli and Madalina Fiterau},
journal= {arXiv preprint arXiv:2507.07270},
year = {2025}
}
备注
Accepted to the 42nd International Conference on Machine Learning Workshop on Machine Learning for Audio