基于最优传输的图匹配跨模态知识迁移学习用于语音识别
音频与语音处理
2025-05-20 v1 人工智能
摘要
将预训练语言模型(PLM)中的语言知识迁移到声学特征学习已被证明可有效提升端到端自动语音识别(E2E-ASR)。然而,在语言和声学模态之间对齐表征仍是一个挑战,由于固有的模态差距。最优传输(OT)已显示在通过最小化语言和声学特征分布之间的 Wasserstein 距离(WD)来缓解这些差距方面具有潜力。然而,先前的 OT 方法忽略了结构关系,将特征向量视为无序集合。为此,我们提出图匹配最优传输(Graph Matching Optimal Transport, GM-OT),将语言和声学序列建模为结构化图。节点代表特征嵌入,边捕获时间和序列关系。GM-OT 最小化节点之间的 WD 和边之间的 Gromov-Wasserstein 距离(GWD),导致一种融合 Gromov-Wasserstein 距离(FGWD)的公式。这实现了结构化对齐,并比现有 OT 方法更高效地进行知识迁移。理论分析进一步表明,语言知识迁移中的先前 OT 方法可视为我们 GM-OT 框架中的一种特殊情况。我们在基于 CTC 的 E2E-ASR 系统上评估了 GM-OT,使用 PLM 进行知识迁移。实验结果在中文 ASR 上的性能显著优于最先进的模型,验证了我们方法的有效性。
关键词
引用
@article{arxiv.2505.13079,
title = {Cross-modal Knowledge Transfer Learning as Graph Matching Based on Optimal Transport for ASR},
author = {Xugang Lu and Peng Shen and Yu Tsao and Hisashi Kawai},
journal= {arXiv preprint arXiv:2505.13079},
year = {2025}
}
备注
To appear in Interspeech 2025