增强基于CTC的语音识别:多样建模单元
音频与语音处理
2024-06-12 v2 人工智能
声音
摘要
近年来,端到端(E2E)自动语音识别(ASR)模型的演进取得了显著进展,这在很大程度上归功于如变换器等深度学习架构的进步。在E2E系统之上,研究者通过对CTC模型的N-best假设进行音素基模型的重新评分,实现了显著的准确率提升。这引发了一个有趣的问题:除了系统组合效应之外,这些改进到底是从哪里来的?我们检视了驱动这些收益的底层机制,并提出了一种高效的联合训练方法,即在多样建模单元上对E2E模型进行联合训练。这种方法不仅将音素基模型和字母基模型的优势进行了对齐,还揭示了以这种多样建模单元的协同方式可以显著提高模型准确率。我们的发现为在开发更稳健和更准确的ASR系统中,对异构建模单元的最优集成提供了新的见解。
引用
@article{arxiv.2406.03274,
title = {Enhancing CTC-based speech recognition with diverse modeling units},
author = {Shiyi Han and Zhihong Lei and Mingbin Xu and Xingyu Na and Zhen Huang},
journal= {arXiv preprint arXiv:2406.03274},
year = {2024}
}