中文

面向个性化语音增强的动态声学补偿与自适应焦点训练

音频与语音处理 2022-11-23 v1

摘要

近年来,越来越多性能优异的个性化语音增强系统(PSE)被提出。然而,两个关键问题仍限制了模型的性能与泛化能力:1)测试含噪语音与目标说话人注册语音之间的声学环境失配;2)难样本挖掘与学习。本文提出动态声学补偿(DAC)以缓解环境失配,其从含噪语音中截取噪声或环境声学片段,并与干净的注册语音相混合。为充分利用训练数据中的难样本,我们提出一种自适应焦点训练(AFT)策略,在训练过程中为难样本与非难样本分配自适应损失权重。进一步引入时频多损失训练,以改进并泛化我们此前用于 PSE 的 sDPCCN 工作。所提方法的有效性在 DNS4 Challenge 数据集上进行了验证。结果表明,DAC 在多项评价指标上带来大幅提升,而 AFT 显著降低了难样本率并产生了明显的 MOS 分数改善。

关键词

引用

@article{arxiv.2211.12097,
  title  = {Dynamic Acoustic Compensation and Adaptive Focal Training for Personalized Speech Enhancement},
  author = {Xiaofeng Ge and Jiangyu Han and Haixin Guan and Yanhua Long},
  journal= {arXiv preprint arXiv:2211.12097},
  year   = {2022}
}