中文

SpeechNAS:面向大规模说话人确认中时延与准确率更好权衡

声音 2022-01-02 v1 计算与语言 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

近来,x-vector 已成为说话人确认中一种成功且流行的方法,其采用时延神经网络 (TDNN) 与统计池化,从变长语音中提取表征说话人的嵌入。基于 x-vector 的改进一直是活跃的研究领域,并已精心设计了大量神经网络,例如扩展 TDNN (E-TDNN)、因子化 TDNN (F-TDNN) 和稠密连接 TDNN (D-TDNN)。本工作中,我们尝试从基于 TDNN 的搜索空间中利用神经架构搜索 (NAS) 确定最优架构,称为 SpeechNAS。借助说话人识别近期进展,如高阶统计池化、多分支机制、D-TDNN 以及带最小超球面能量 (MHE) 的角加性间隔 softmax (AAM) 损失,SpeechNAS 在大规模文本无关说话人识别数据集 VoxCeleb1 上自动发现了五种具有不同参数量和 GFLOPs 的网络架构,从 SpeechNAS-1 到 SpeechNAS-5。我们所得最佳神经网络在 VoxCeleb1 标准测试集上取得了 1.02% 的等错误率 (EER),大幅超越先前基于 TDNN 的 SOTA 方法。代码与训练权重见 https://github.com/wentaozhu/speechnas.git

关键词

引用

@article{arxiv.2109.08839,
  title  = {SpeechNAS: Towards Better Trade-off between Latency and Accuracy for Large-Scale Speaker Verification},
  author = {Wentao Zhu and Tianlong Kong and Shun Lu and Jixiang Li and Dawei Zhang and Feng Deng and Xiaorui Wang and Sen Yang and Ji Liu},
  journal= {arXiv preprint arXiv:2109.08839},
  year   = {2022}
}

备注

8 pages, 3 figures, 3 tables. Accepted by ASRU2021