基于口语语言集成预测的古吉拉特语-英语语码转换语音识别
计算与语言
2024-03-14 v1 人工智能
机器学习
摘要
语码转换语音识别中一项重要且困难的任务是识别语言,因为两种语言中的许多单词听起来可能相似,尤其是在某些口音中。我们专注于通过以逐层监督的方式,在输出中根据单词和字符的语言ID来调节Transformer层,从而提高端到端自动语音识别模型的性能。为此,我们提出了两种在多头注意力机制中引入语言特定参数和可解释性的方法,并实现了一种有助于保持输入对齐连续性的时序损失。尽管未能显著降低词错误率(WER),但我们的方法在仅从语音数据预测正确语言方面显示出潜力。我们通过在序列中丢弃语言ID(LID)来引入语言预测的正则化,这有助于对齐长的重复输出序列。
引用
@article{arxiv.2403.08011,
title = {Gujarati-English Code-Switching Speech Recognition using ensemble prediction of spoken language},
author = {Yash Sharma and Basil Abraham and Preethi Jyothi},
journal= {arXiv preprint arXiv:2403.08011},
year = {2024}
}
备注
Bachelor's thesis, 28 pages, includes appendix