Spectron:基于条件转换器的目标说话人提取方法
声音
2024-09-04 v1 机器学习
多媒体
音频与语音处理
摘要
最近,基于注意力的转换器已成为自然语言处理、计算机视觉、信号处理等众多深度学习应用中的事实标准。在本文中,我们提出一种基于转换器的端到端模型,用于从单声道多说话人混合音频信号中提取目标说话人的语音。不同于现有说话人提取方法,我们引入两个额外目标,以施加说话人嵌入一致性和波形编码可逆性,并联合训练说话人编码器和语音分离器,以更好地捕获说话人条件嵌入。此外,我们利用多尺度判别器来细化提取语音的感知质量。我们的实验表明,在分离器主干中使用双路径转换器以及所提出的训练范式,使CNN基准性能提升了 dB。最后,我们与最新领先方法进行比较,表明该模型在不创建额外数据依赖关系的情况下,以平均 dB的性能优势超越现有方法。
引用
@article{arxiv.2409.01352,
title = {Spectron: Target Speaker Extraction using Conditional Transformer with Adversarial Refinement},
author = {Tathagata Bandyopadhyay},
journal= {arXiv preprint arXiv:2409.01352},
year = {2024}
}