中文

基于音节级与字符级目标的日语 ASR 交替中间条件化

计算与语言 2023-03-14 v2 声音 音频与语音处理

摘要

端到端自动语音识别直接将输入语音映射为字符。然而,当多个不同发音应映射为一个字符,或一个发音被多个不同字符共享时,该映射会有问题。由于日语汉字,日语 ASR 受此类多对一与一对多映射问题影响最甚。为缓解这些问题,我们引入字符与音节间的显式交互,使用自条件化连接主义时序分类(CTC),其中上层“自条件化”于来自下层的的中间预测。所提方法利用字符级与音节级中间预测作为条件化特征,以处理字符与音节间的相互依赖。在日语自发语料库上的实验结果表明,所提方法优于传统的多任务与自条件化 CTC 方法。

关键词

引用

@article{arxiv.2204.00175,
  title  = {Alternate Intermediate Conditioning with Syllable-level and Character-level Targets for Japanese ASR},
  author = {Yusuke Fujita and Tatsuya Komatsu and Yusuke Kida},
  journal= {arXiv preprint arXiv:2204.00175},
  year   = {2023}
}

备注

SLT 2022