注意力是否总是必需的?一项基于语音的语言识别案例研究
机器学习
2026-03-04 v3 计算与语言
声音
音频与语音处理
信号处理
摘要
语言识别(LID)是自动语音识别(ASR)领域中的一项关键预处理过程,涉及从音频样本中识别口语语言。当代能够处理多语言语音的系统要求用户在使用前明确指定一种或多种语言。在 multilingual 场景下,当 ASR 系统无法理解所说话语的语言而导致语音识别失败时,LID 任务发挥着重要作用。本研究提出了基于卷积循环神经网络(CRNN)的 LID 方法,该方法设计用于音频样本的梅尔频率倒谱系数(MFCC)特征。此外,我们复现了某些最先进的方法,具体而言是卷积神经网络(CNN)和基于注意力的卷积循环神经网络(带注意力的 CRNN),并与我们基于 CRNN 的方法进行了比较分析。我们在十三种不同的印度语言上进行了全面评估,我们的模型达到了超过 98% 的分类准确率。对于语言上相似的语言,LID 模型表现出 97% 到 100% 的高性能水平。所提出的 LID 模型对额外语言具有高度可扩展性,并表现出很强的抗噪声能力,在应用于欧洲语言(EU)数据集的噪声环境下达到了 91.2% 的准确率。
引用
@article{arxiv.2110.03427,
title = {Is Attention always needed? A Case Study on Language Identification from Speech},
author = {Atanu Mandal and Santanu Pal and Indranil Dutta and Mahidas Bhattacharya and Sudip Kumar Naskar},
journal= {arXiv preprint arXiv:2110.03427},
year = {2026}
}
备注
Accepted for publication in Natural Language Engineering