中文

基于 CTC 的 ASR 中采用 Sinkhorn 注意力的分层跨模态知识迁移

音频与语音处理 2023-09-29 v1 声音

摘要

由于文本与声学建模之间的模态差异,将预训练语言模型(PLM)的语言知识高效迁移至声学编码以用于自动语音识别(ASR)仍是一项挑战。在本研究中,我们提出一种基于时序连接主义时序分类(CTC)的 ASR 系统中的跨模态知识迁移(CMKT)学习框架,其中应用了与语言表示的分层声学对齐。此外,我们提出在跨模态对齐过程中使用 Sinkhorn 注意力,其中 transformer 注意力是该 Sinkhorn 注意力过程的一个特例。CMKT 学习旨在迫使声学编码器为 ASR 编码丰富的语言知识。在 AISHELL-1 数据集上,采用 CTC 贪心解码进行推理(不使用任何语言模型),我们取得了最优性能,开发集与测试集的字错误率(CERs)分别为 3.64% 和 3.94%,相较基线 CTC-ASR 系统分别对应 34.18% 和 34.88% 的相对提升。

关键词

引用

@article{arxiv.2309.16093,
  title  = {Hierarchical Cross-Modality Knowledge Transfer with Sinkhorn Attention for CTC-based ASR},
  author = {Xugang Lu and Peng Shen and Yu Tsao and Hisashi Kawai},
  journal= {arXiv preprint arXiv:2309.16093},
  year   = {2023}
}

备注

Submitted to ICASSP 2024