Y-Vector:用于说话人嵌入的多尺度波形编码器
音频与语音处理
2021-06-10 v3 声音
摘要
最先进的文本无关说话人验证系统通常使用倒谱特征或滤波器组能量作为语音特征。近期研究尝试直接从原始波形提取说话人嵌入,并展示了具有竞争力的结果。本文中,我们提出一种新颖的多尺度波形编码器,其使用三个具有不同时间尺度的卷积分支从波形计算语音特征。这些特征随后经压缩激励块、多级特征聚合器以及时延神经网络(TDNN)处理以计算说话人嵌入。我们表明,所提嵌入在说话人验证上大幅优于现有基于原始波形的说话人嵌入。对所学滤波器的进一步分析显示,多尺度编码器在不同尺度关注不同频带,同时产生比任一单尺度对应物更平坦的整体频率响应。
引用
@article{arxiv.2010.12951,
title = {Y-Vector: Multiscale Waveform Encoder for Speaker Embedding},
author = {Ge Zhu and Fei Jiang and Zhiyao Duan},
journal= {arXiv preprint arXiv:2010.12951},
year = {2021}
}
备注
Accepted by Interspeech 2021