利用基于 Transformer 解码器的吸引子提升未知说话人数量的语音分离
音频与语音处理
2024-01-24 v1 声音
摘要
我们提出了一种新颖的语音分离模型,旨在分离包含未知数量说话人的混合语音。该模型堆叠了 1) 一个能对频谱-时间模式进行建模的双路径处理模块,2) 一个能处理未知数量说话人的基于 Transformer 解码器的吸引子 (TDA) 计算模块,以及 3) 能对说话人间关系进行建模的三路径处理模块。给定一组固定且少量的可学习说话人查询以及由双路径模块生成的混合嵌入,TDA 推断这些查询的关系并为每个说话人生成一个吸引子向量。然后,通过特征线性调制条件化,将估计的吸引子与混合嵌入结合,创建出一个说话人维度。经过 TDA 产生的说话人信息条件化的混合嵌入,被送入最终的三路径模块,该模块通过增加一条专用于说话人间处理的额外路径来增强双路径模块。所提出的方法优于文献中先前报道的最佳结果,在 WSJ0-2mix 和 3mix 数据集上分别取得了 24.0 dB 和 23.7 dB 的 SI-SDR 改善 (SI-SDRi),且仅使用单个模型训练来分离 2 人和 3 人混合语音。该模型在统计声源数量和分离多达 5 个说话人的混合语音方面,也表现出强大的性能和泛化能力。
引用
@article{arxiv.2401.12473,
title = {Boosting Unknown-number Speaker Separation with Transformer Decoder-based Attractor},
author = {Younglo Lee and Shukjae Choi and Byeong-Yeol Kim and Zhong-Qiu Wang and Shinji Watanabe},
journal= {arXiv preprint arXiv:2401.12473},
year = {2024}
}
备注
5 pages, 4 figures, accepted by ICASSP 2024