基于音节级与字符级目标的日语 ASR 交替中间条件化
计算与语言
2023-03-14 v2 声音
音频与语音处理
摘要
端到端自动语音识别直接将输入语音映射为字符。然而,当多个不同发音应映射为一个字符,或一个发音被多个不同字符共享时,该映射会有问题。由于日语汉字,日语 ASR 受此类多对一与一对多映射问题影响最甚。为缓解这些问题,我们引入字符与音节间的显式交互,使用自条件化连接主义时序分类(CTC),其中上层“自条件化”于来自下层的的中间预测。所提方法利用字符级与音节级中间预测作为条件化特征,以处理字符与音节间的相互依赖。在日语自发语料库上的实验结果表明,所提方法优于传统的多任务与自条件化 CTC 方法。
引用
@article{arxiv.2204.00175,
title = {Alternate Intermediate Conditioning with Syllable-level and Character-level Targets for Japanese ASR},
author = {Yusuke Fujita and Tatsuya Komatsu and Yusuke Kida},
journal= {arXiv preprint arXiv:2204.00175},
year = {2023}
}
备注
SLT 2022