基于对抗合成数据增强的语码转换语音语言识别
音频与语音处理
2024-09-02 v2 计算机视觉与模式识别
机器学习
摘要
语音语言识别(LID)是自动语音识别(ASR)的重要子任务,用于分类音频片段中的语言。自动 LID 在多语言国家发挥着有益作用。在多个国家,由于多语言场景中两种或多种语言在对话中混合,语言识别变得困难。这种语音现象称为语码混合或语码转换(code-switching)。这不仅出现在印度,也出现在许多亚洲国家。此类语码混合数据难以获取,进一步削弱了语音 LID 的能力。因此,本文主要利用数据增强作为解决语码转换类数据稀缺问题的方案。本研究聚焦于与英语混合的印度语言。对与英语混合的印地语进行语音 LID。本研究提出基于生成对抗网络(GAN)的数据增强技术,使用梅尔频谱图处理音频数据。GAN 已在图像域中被证明能准确表示真实数据分布。所提研究利用了 GAN 在语音域(如语音分类、自动语音识别等)的这些能力。训练 GAN 生成少数类语码混合的梅尔频谱图,然后用于增强分类器数据。与作为基线参考的卷积循环神经网络(CRNN)分类器相比,使用 GAN 使非加权平均召回率总体提升 3.5%。
引用
@article{arxiv.2205.15747,
title = {Adversarial synthesis based data-augmentation for code-switched spoken language identification},
author = {Parth Shastri and Chirag Patil and Poorval Wanere and Shrinivas Mahajan and Abhishek Bhatt and Hardik Sailor},
journal= {arXiv preprint arXiv:2205.15747},
year = {2024}
}
备注
9 pages, 8 figures, updated