基于自监督的语音与内容解耦用于说话人识别
音频与语音处理
2023-11-02 v3 人工智能
摘要
对于说话人识别而言,由于语音中混杂了说话人特征与内容,难以从中提取准确的说话人表征。本文提出一种解耦框架,同时建模语音中的说话人特征与内容变异性。该框架通过三个高斯推断层实现,每层由一个可学习的转移模型组成,用于提取不同的语音成分。值得注意的是,专门设计了一个增强型转移模型来建模复杂的语音动态。我们还提出了一种自监督方法,除说话人身份外无需其他标签即可动态解耦内容。所提框架的有效性通过在 VoxCeleb 和 SITW 数据集上的实验得到验证,EER 和 minDCF 分别平均降低 9.56% 和 8.24%。由于无需额外的模型训练或数据,该方法在实际使用中易于应用。
引用
@article{arxiv.2310.01128,
title = {Disentangling Voice and Content with Self-Supervision for Speaker Recognition},
author = {Tianchi Liu and Kong Aik Lee and Qiongqiong Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2310.01128},
year = {2023}
}
备注
Accepted to NeurIPS 2023 (main track)