基于非峰值 CTC 损失与深度语言后验注入提升零口语 ASR 性能
音频与语音处理
2024-12-13 v1 计算与语言
机器学习
声音
摘要
Code-switching——即在对话中交替切换语言——仍是 end-to-end(E2E)自动语音识别(ASR)系统面临的主要挑战之一,由于声学和语义混淆现象导致。这种问题源于 ASR 系统难以有效处理语言的快速交替,往往导致显著的性能下降。我们的主要贡献至少有三点:首先,我们将语言识别(LID)信息整合到编码器的多个中间层,以充实输出嵌入,提供更详细的语言信息。其次,通过 novel language boundary alignment loss 的应用,后续 ASR 模块能够更有效地利用内部语言后验知识。第三,我们探讨了利用语言后验来促进共享编码器与语言特定编码器之间深度互动的可行性。通过在 SEAME 语料库上的全面实验,我们验证了我们的方法优于现有方法,即基于无峰值 CTC 损失和深度语言后验注入的方案,进一步增强了编码器对语言的敏感性。
引用
@article{arxiv.2412.08651,
title = {Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection},
author = {Tzu-Ting Yang and Hsin-Wei Wang and Yi-Cheng Wang and Berlin Chen},
journal= {arXiv preprint arXiv:2412.08651},
year = {2024}
}
备注
SLT 2024