中文

基于端到端注意力的文本相关说话人验证

计算与语言 2017-01-04 v1 机器学习

摘要

本文提出了一种用于文本相关说话人验证的新型端到端系统。此前,将语音判别/说话人判别 DNN 作为说话人验证的特征提取器已显示出有希望的结果。提取的帧级(DNN 瓶颈、后验或 d-vector)特征被等权重并聚合,以计算话语级说话人表示(d-vector 或 i-vector)。在本工作中,我们使用说话人判别 CNN 来提取抗噪的帧级特征。这些特征通过注意力机制被智能地组合以形成话语级说话人向量。所提出的注意力模型利用说话人判别信息和语音信息来学习权重。包括 CNN 和注意力模型在内的整个系统使用端到端准则进行联合优化。训练算法精确模仿评估过程——将测试话语和少量目标说话人话语直接映射为单一验证分数。该算法能自动为每个目标说话人选择最相似的冒充者来训练网络。我们在 Windows 1010 “Hey Cortana” 说话人验证任务上证明了所提出的端到端系统的有效性。

关键词

引用

@article{arxiv.1701.00562,
  title  = {End-to-End Attention based Text-Dependent Speaker Verification},
  author = {Shi-Xiong Zhang and Zhuo Chen and Yong Zhao and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:1701.00562},
  year   = {2017}
}

备注

@article{zhang2016End2End, title={End-to-End Attention based Text-Dependent Speaker Verification}, author={Shi-Xiong Zhang, Zhuo Chen$^{\dag}$, Yong Zhao, Jinyu Li and Yifan Gong}, journal={IEEE Workshop on Spoken Language Technology}, pages={171--178}, year={2016}, publisher={IEEE} }