中文

目标说话人分离中注册说话人嵌入被忽视方面的定量证据

声音 2022-10-27 v2 人工智能 音频与语音处理

摘要

单通道目标说话人分离(TSS)旨在给定该说话人的注册语句前提下,从多人混合语音中提取出特定说话人声音。典型的深度学习 TSS 框架由获取注册说话人嵌入的上游模型与以嵌入为条件执行分离的下游模型组成。本文考察注册嵌入中若干重要却被忽视的方面,包括广泛使用的说话人识别嵌入的适用性、log-mel 滤波器组与自监督嵌入的引入,以及嵌入的跨数据集泛化能力。结果表明,说话人识别嵌入可能因次优度量、训练目标或常见预处理而丢失相关信息。相比之下,滤波器组与自监督嵌入均保留了说话人信息的完整性,但前者在跨数据集评测中一致优于后者。此前被忽视的滤波器组嵌入所展现的具竞争力的分离与泛化性能在研究中保持一致,这呼吁未来对更优上游特征的研究。

关键词

引用

@article{arxiv.2210.12635,
  title  = {Quantitative Evidence on Overlooked Aspects of Enrollment Speaker Embeddings for Target Speaker Separation},
  author = {Xiaoyu Liu and Xu Li and Joan Serrà},
  journal= {arXiv preprint arXiv:2210.12635},
  year   = {2022}
}

备注

Submitted version to ICASSP 2023