基于高效 Transformer 模型的单通道多说话人语音分离
声音
2026-02-19 v2 机器学习
音频与语音处理
摘要
鸡尾酒会问题是指难以从多个说话人混合的语音中分离或辨别出单个说话人的场景。该领域已有若干研究,但模型的规模与复杂度往往以语音分离的准确率和鲁棒性为代价进行权衡。"单通道多说话人语音分离"提出了一种基于 Transformer 架构及其高效变体的语音分离模型。该模型使用包含不同说话人话语的 LibriMix 数据集进行训练,可从混合音频输入中分离出 2 个不同说话人的声源。所开发的模型致力于降低语音分离模型的计算复杂度,同时与现有主流语音分离模型的性能之间做到最小程度的权衡,并已在这一目标上取得显著进展。本项目预期将以计算效率为核心,为语音分离领域的持续研究作出更多贡献。
引用
@article{arxiv.2308.00010,
title = {Monaural Multi-Speaker Speech Separation Using Efficient Transformer Model},
author = {S. Rijal and R. Neupane and S. P. Mainali and S. K. Regmi and S. Maharjan},
journal= {arXiv preprint arXiv:2308.00010},
year = {2026}
}
备注
The paper doesn't qualify for replication, no clear instruction for data preparation to see the results being replicated. Multiple grammar mistakes, and need a through review prior to publish