TranUSR:基于音素到词转码器的统一语音表示学习用于跨语言语音识别
音频与语音处理
2023-10-10 v3
摘要
UniSpeech 通过多任务自监督学习将潜在表示显式对齐到音素单元,在跨语言自动语音识别(ASR)中取得了优越性能。尽管所学表示能从高资源语言良好迁移至低资源语言,但在下游 ASR 中直接从这些语音表示预测词颇具挑战。本文中,我们提出 TranUSR,一种由预训练 UniData2vec 与音素到词转码器组成的两阶段模型。不同于 UniSpeech,UniData2vec 以教师模型连续且具上下文的表示替换量化离散表示,用于音素感知的预训练。随后,转码器借助额外文本学习将音素翻译为词,实现直接词生成。在 Common Voice 上的实验表明,UniData2vec 相较 UniSpeech 降低 5.3% 的 PER,而转码器相较字素微调带来 14.4% 的 WER 降低。
引用
@article{arxiv.2305.13629,
title = {TranUSR: Phoneme-to-word Transcoder Based Unified Speech Representation Learning for Cross-lingual Speech Recognition},
author = {Hongfei Xue and Qijie Shao and Peikun Chen and Pengcheng Guo and Lei Xie and Jie Liu},
journal= {arXiv preprint arXiv:2305.13629},
year = {2023}
}
备注
5 pages, 3 figures. Accepted by INTERSPEECH 2023