中文

Spectron:基于条件转换器的目标说话人提取方法

声音 2024-09-04 v1 机器学习 多媒体 音频与语音处理

摘要

最近,基于注意力的转换器已成为自然语言处理、计算机视觉、信号处理等众多深度学习应用中的事实标准。在本文中,我们提出一种基于转换器的端到端模型,用于从单声道多说话人混合音频信号中提取目标说话人的语音。不同于现有说话人提取方法,我们引入两个额外目标,以施加说话人嵌入一致性和波形编码可逆性,并联合训练说话人编码器和语音分离器,以更好地捕获说话人条件嵌入。此外,我们利用多尺度判别器来细化提取语音的感知质量。我们的实验表明,在分离器主干中使用双路径转换器以及所提出的训练范式,使CNN基准性能提升了3.123.12 dB。最后,我们与最新领先方法进行比较,表明该模型在不创建额外数据依赖关系的情况下,以平均4.14.1 dB的性能优势超越现有方法。

关键词

引用

@article{arxiv.2409.01352,
  title  = {Spectron: Target Speaker Extraction using Conditional Transformer with Adversarial Refinement},
  author = {Tathagata Bandyopadhyay},
  journal= {arXiv preprint arXiv:2409.01352},
  year   = {2024}
}