中文

面向自动语音识别的基于时序保持的最优传输跨模态知识迁移学习

声音 2024-09-06 v2 人工智能 计算与语言 音频与语音处理

摘要

将预训练语言模型(PLM)中的语言知识迁移到声学模型上已被证明可显著提升自动语音识别(ASR)性能。然而,由于跨模态中特征分布的异质性,设计有效的方法在语言序列与声学序列之间进行特征对齐与知识迁移仍是一个具有挑战性的任务。最优传输(OT)由于能够高效衡量概率分布之间的差异,具有巨大的潜力用于声学与语言模态间的对齐与知识迁移。然而,原始 OT 将声学与语言特征序列视为两个无序集合进行对齐,忽略了序列在 OT 耦合估计过程中的时间顺序信息。因此,需要进行耗时的预训练阶段来学习声学与语言表征之间的良好对齐。本文提出一种基于时序保持最优传输(TOT)的跨模态对齐与知识迁移框架(TOT-CAKT)用于 ASR。在 TOT-CAKT 中,声学序列的相邻局部帧被平滑映射到语言序列的相邻区域,从而在特征对齐与匹配中保持其时间顺序关系。借助 TOT-CAKT 模型框架,我们针对预训练中文语言模型开展了中文 ASR 实验。我们的实验结果表明,所提出的 TOT-CAKT 显著优于多种采用语言知识迁移的前沿模型,解决了原始 OT 方法在语音识别中顺序特征对齐的局限。

关键词

引用

@article{arxiv.2409.02239,
  title  = {Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR},
  author = {Xugang Lu and Peng Shen and Yu Tsao and Hisashi Kawai},
  journal= {arXiv preprint arXiv:2409.02239},
  year   = {2024}
}

备注

Accepted to IEEE SLT 2024