中文

SEF-PNet:基于局部与全局上下文聚合的无说话人编码器的个性化语音增强

音频与语音处理 2025-01-22 v1 声音

摘要

个性化语音增强(PSE)方法通常依赖预训练的说话人验证模型或自设计的说话人编码器,以提取目标说话人线索,指导PSE模型隔离所需语音。然而,这类方法存在显著的模型复杂度且常未充分利用登记说话人信息,限制了PSE模型的潜在性能。为此,我们提出一种新型无说话人编码器的PSE网络,称为SEF-PNet,充分利用登记语音和噪声混合信号中的信息。SEF-PNet包含两个关键创新:交互式说话人适应(ISA)和局部-全局上下文聚合(LCA)。ISA动态调制登记信号与噪声信号之间的相互作用,以增强说话人适应;LCA在PSE编码器中采用先进的通道注意力机制,有效整合局部和全局上下文信息,从而提升特征学习。在Libri2Mix数据集上的实验表明,SEF-PNet显著优于基准模型,实现了SOTA水平的PSE性能。

关键词

引用

@article{arxiv.2501.11274,
  title  = {SEF-PNet: Speaker Encoder-Free Personalized Speech Enhancement with Local and Global Contexts Aggregation},
  author = {Ziling Huang and Haixin Guan and Haoran Wei and Yanhua Long},
  journal= {arXiv preprint arXiv:2501.11274},
  year   = {2025}
}

备注

accpeted by ICASSP2025