中文

通过说话人感知的模型选择实现零样本个性化语音增强

音频与语音处理 2021-05-11 v1 机器学习 声音

摘要

本文提出一种新颖的零样本学习方法,通过稀疏激活的集成模型实现个性化语音增强。针对特定测试时说话人优化语音去噪系统可提升性能并降低运行复杂度。然而,若无法采集测试时说话人的数据,则测试时模型自适应可能颇具挑战。为此,我们提出使用一种集成模型,其中每个专家模块对来自训练集说话人不同分区的含噪语音进行去噪。门控模块以低成本估计测试时说话人特征,形式为嵌入向量,并选择最合适的专家模块对测试信号去噪。将训练集说话人分组为不重叠的语义相似群组并非易事且定义不清。为此,我们首先使用含噪语音对训练一个 Siamese 网络,根据其输出向量所对应语音是否来自同一说话人而最大化或最小化其相似度。接着,我们对每个训练集说话人的平均嵌入向量所形成的潜空间执行 k-means 聚类。借此,我们划定说话人群组并训练围绕完整训练集分区优化的专家模块。实验表明,由低容量专家构成的集成模型可胜过高容量通才模型,且具有更高效率及对未见测试时说话人的更佳自适应能力。

关键词

引用

@article{arxiv.2105.03542,
  title  = {Zero-Shot Personalized Speech Enhancement through Speaker-Informed Model Selection},
  author = {Aswin Sivaraman and Minje Kim},
  journal= {arXiv preprint arXiv:2105.03542},
  year   = {2021}
}

备注

5 pages, 3 figures, submitted to 2021 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA)