中文

利用 Zipformer 模型提升儿童导向语音代码切换中的语言识别效果

计算与语言 2025-08-14 v1 声音

摘要

代码切换和儿童导向场景中的语言识别面临着显著挑战,尤其是在双语环境中。本文通过使用 Zipformer 处理包含两种不平衡语言(普通话和英语)的语音语句中的细微差异。本工作表明,Zipformer 的内部层能够有效编码语言特征,可用于语言识别。我们提出了从内部层提取嵌入并与不同后端进行比较的选择方法。我们的分析显示,Zipformer 在各种后端上都表现出鲁棒性。我们的方法有效处理不平衡数据,实现了平衡准确率(Balanced Accuracy, BAC)为81.89%,较语言识别基线提高了15.47%。这些发现凸显了Transformer 编码器架构模型在实际场景中的潜力。

关键词

引用

@article{arxiv.2508.09430,
  title  = {Leveraging Zipformer Model for Effective Language Identification in Code-Switched Child-Directed Speech},
  author = {Lavanya Shankar and Leibny Paola Garcia Perera},
  journal= {arXiv preprint arXiv:2508.09430},
  year   = {2025}
}