中文

基于自监督的语音与内容解耦用于说话人识别

音频与语音处理 2023-11-02 v3 人工智能

摘要

对于说话人识别而言,由于语音中混杂了说话人特征与内容,难以从中提取准确的说话人表征。本文提出一种解耦框架,同时建模语音中的说话人特征与内容变异性。该框架通过三个高斯推断层实现,每层由一个可学习的转移模型组成,用于提取不同的语音成分。值得注意的是,专门设计了一个增强型转移模型来建模复杂的语音动态。我们还提出了一种自监督方法,除说话人身份外无需其他标签即可动态解耦内容。所提框架的有效性通过在 VoxCeleb 和 SITW 数据集上的实验得到验证,EER 和 minDCF 分别平均降低 9.56% 和 8.24%。由于无需额外的模型训练或数据,该方法在实际使用中易于应用。

关键词

引用

@article{arxiv.2310.01128,
  title  = {Disentangling Voice and Content with Self-Supervision for Speaker Recognition},
  author = {Tianchi Liu and Kong Aik Lee and Qiongqiong Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2310.01128},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023 (main track)