用于方言识别的动态多尺度卷积
计算与语言
2021-08-18 v1
摘要
基于时间延迟神经网络(TDNN)的方法被广泛用于方言识别。然而,在以往应用 TDNN 的工作中,不同特征尺度下的细微差异被忽视了。为解决此问题,我们提出了一种名为动态多尺度卷积的新架构,它由动态核卷积、局部多尺度学习和全局多尺度池化组成。动态核卷积自适应地捕获短期与长期上下文之间的特征。局部多尺度学习以细粒度表示多尺度特征,能够增大卷积操作的感受野范围。此外,应用全局多尺度池化来聚合来自不同瓶颈层的特征,以便从多方面收集信息。所提架构在 2020 年东方语言识别(OLR)挑战赛的 AP20-OLR-dialect-task 上显著优于最先进系统,取得了 0.067 的最佳平均代价性能(Cavg)和 6.52% 的最佳等错误率(EER)。与已知最佳结果相比,我们的方法分别实现了 9% 的 Cavg 和 45% 的 EER 相对提升。此外,所提模型的参数量比已知最佳模型少 91%。
引用
@article{arxiv.2108.07787,
title = {Dynamic Multi-scale Convolution for Dialect Identification},
author = {Tianlong Kong and Shouyi Yin and Dawei Zhang and Wang Geng and Xin Wang and Dandan Song and Jinwen Huang and Huiyu Shi and Xiaorui Wang},
journal= {arXiv preprint arXiv:2108.07787},
year = {2021}
}