基于自注意力池化与深度一维时间-通道可分离卷积的低资源口语识别
音频与语音处理
2021-06-02 v1 计算与语言
机器学习
声音
摘要
本备忘录描述了NTR/TSU在Dialog2021会议低资源ASR挑战赛语言识别赛道上的获奖提交。口语语言识别(LID)是多语言自动语音识别(ASR)系统流程中的重要步骤。传统上,ASR任务需要大量标注数据,而世界上大多数语言(包括俄罗斯大多数语言)都无法获得这些数据。在本备忘录中,我们展示了带有自注意力池化层的卷积神经网络在低资源语言识别任务中展现出有前景的结果,并为低资源ASR挑战数据集确立了SOTA。此外,我们将该数据集与显著更多样的VoxForge数据集的混淆矩阵结构进行比较,并提出且论证了如下假设:只要数据集足够多样,使得性别、年龄等其他分类因素得到良好平均,LID系统的混淆矩阵就承载语言相似性度量。
引用
@article{arxiv.2106.00052,
title = {Low-Resource Spoken Language Identification Using Self-Attentive Pooling and Deep 1D Time-Channel Separable Convolutions},
author = {Roman Bedyakin and Nikolay Mikhaylovskiy},
journal= {arXiv preprint arXiv:2106.00052},
year = {2021}
}
备注
Accepted to Dialog2021. arXiv admin note: text overlap with arXiv:2104.11985