使用 NetFV 与 NetVLAD 的端到端语言识别
音频与语音处理
2018-09-11 v1 人工智能
声音
信号处理
摘要
本文中,我们将 NetFV 与 NetVLAD 层应用于端到端语言识别任务。NetFV 与 NetVLAD 层分别是标准 Fisher Vector 与 Vector of Locally Aggregated Descriptors (VLAD) 方法的可微实现。二者均可将特征向量序列编码为固定维向量,这对于处理那些变长语音段非常重要。我们首先给出经典 i-vector 与上述编码方案之间的关联与差异。然后,我们构建了一个灵活的端到端框架,包含卷积神经网络(CNN)架构与一个用于语言识别任务的编码层(NetFV 或 NetVLAD)。在 NIST LRE 2007 闭集任务上的实验结果表明,所提系统相对于常规 i-vector 基线与 CNN 时间平均池化系统分别取得了显著的 EER 降低。
引用
@article{arxiv.1809.02906,
title = {End-to-end Language Identification using NetFV and NetVLAD},
author = {Jinkun Chen and Weicheng Cai and Danwei Cai and Zexin Cai and Haibin Zhong and Ming Li},
journal= {arXiv preprint arXiv:1809.02906},
year = {2018}
}
备注
Accepted for ISCSLP 2018