基于最优传输的跨模态对齐用于 CTC 语音识别
音频与语音处理
2023-09-26 v1 声音
摘要
基于时序连接主义时序分类(CTC)的自动语音识别(ASR)是最成功的端到端(E2E)ASR 框架之一。然而,由于解码中的 token 独立假设,需要外部语言模型(LM),这破坏了其快速并行解码特性。已有若干研究提出将预训练 LM(PLM)的语言知识迁移至基于 CTC 的 ASR。由于 PLM 由文本构建而声学模型由语音训练,为将上下文相关的语言知识从 PLM 迁移到声学编码,需要进行跨模态对齐。本研究提出一种基于最优传输(OT)的新型跨模态对齐算法。在对齐过程中,利用 OT 获得传输耦合矩阵,进而用于变换潜声学表示以匹配 PLM 编码的上下文相关语言特征。基于该对齐,潜声学特征被强制编码上下文相关语言信息。我们将此潜声学特征集成以构建基于 conformer 编码器的 CTC ASR 系统。在 AISHELL-1 语料库上,我们的系统在开发集和测试集分别取得 3.96% 和 4.27% 的字错率(CER),相较无跨模态知识迁移的基线 conformer CTC ASR 系统相对提升 28.39% 和 29.42%。
引用
@article{arxiv.2309.13650,
title = {Cross-modal Alignment with Optimal Transport for CTC-based ASR},
author = {Xugang Lu and Peng Shen and Yu Tsao and Hisashi Kawai},
journal= {arXiv preprint arXiv:2309.13650},
year = {2023}
}
备注
Accepted to IEEE ASRU 2023