中文

用于低资源多语言语音识别中层次Softmax的跨语言嵌入聚类

计算与语言 2025-01-30 v1 声音 音频与语音处理

摘要

我们提出了一种新颖的方法,聚焦于自动语音识别(ASR)的解码阶段,增强了多语言性能,特别是对于低资源语言。它利用跨语言嵌入聚类方法构建层次Softmax(H-Softmax)解码器,使得不同语言中的相似标记能够共享相似的解码器表示。这解决了先前基于Huffman的H-Softmax方法的局限性,该方法在标记相似性评估中依赖于浅层特征。通过在15种语言的下采样数据集上的实验,我们证明了我们的方法在提高低资源多语言ASR准确性方面的有效性。

关键词

引用

@article{arxiv.2501.17615,
  title  = {Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition},
  author = {Zhengdong Yang and Qianying Liu and Sheng Li and Fei Cheng and Chenhui Chu},
  journal= {arXiv preprint arXiv:2501.17615},
  year   = {2025}
}