S-vectors与TESA:基于Transformer编码器的说话人嵌入及说话人认证器
音频与语音处理
2021-12-14 v2 声音
摘要
最流行的说话人嵌入之一是x-vectors,其从一种以层逐步构建更大时间上下文的架构中获得。本文中,我们提出从为说话人分类训练的Transformer编码器中导出说话人嵌入。构建Transformer编码器所基于的自注意力关注整条语音上所有特征,可能更适于捕捉语音中的说话人特性。我们将所提说话人分类模型获得的说话人嵌入称为s-vectors,以强调其来自重度依赖自注意力的架构。通过实验,我们证明s-vectors优于x-vectors。除s-vectors外,我们还提出一种基于Transformer编码器的说话人验证新架构,以替代基于常规概率线性判别分析(PLDA)的说话人验证。该架构受来自Transformers的双向编码器表示(BERT)的下一句预测任务启发,我们将两条语音的s-vectors输入以验证它们是否属于同一说话人。我们命名此架构为Transformer编码器说话人认证器(TESA)。我们的实验表明,s-vectors结合TESA的性能优于s-vectors结合常规基于PLDA的说话人验证。
引用
@article{arxiv.2008.04659,
title = {S-vectors and TESA: Speaker Embeddings and a Speaker Authenticator Based on Transformer Encoder},
author = {N J Metilda Sagaya Mary and S Umesh and Sandesh V Katta},
journal= {arXiv preprint arXiv:2008.04659},
year = {2021}
}
备注
Version 2, Accepted for publication in IEEE TASLP