基于命名实体感知模型与音素相似度估计的免重训练定制ASR用于同音异形词
声音
2023-05-30 v1 计算与语言
音频与语音处理
摘要
端到端自动语音识别(E2E-ASR)具有提升性能的潜力,但需解决的一个具体问题是其难以处理同音异形词:即发音相同、词性相同但拼写不同的命名实体(NEs)。这常出现在发音相同但汉字不同的日本人名中。由于此类NE词往往是重要关键词,若ASR将其误识别,很容易丧失用户信任。为解决这些问题,本文提出一种基于命名实体感知的E2E-ASR模型与音素相似度估计的免重训练E2E-ASR定制新方法。实验结果表明,在选择人名作为目标NE时,所提方法相对于传统E2E-ASR模型平均将目标NE字符错误率降低了35.7%。
引用
@article{arxiv.2305.17846,
title = {Retraining-free Customized ASR for Enharmonic Words Based on a Named-Entity-Aware Model and Phoneme Similarity Estimation},
author = {Yui Sudo and Kazuya Hata and Kazuhiro Nakadai},
journal= {arXiv preprint arXiv:2305.17846},
year = {2023}
}
备注
accepted by INTERSPEECH2023