有监督声学嵌入及其跨语言可迁移性
计算与语言
2023-01-04 v1 声音
音频与语音处理
摘要
在语音识别中,对输入信号的音素内容进行建模同时丢弃说话人变化和噪声等无关因素至关重要,这在低资源环境下具有挑战性。自监督预训练已被提出作为改善有监督和无人监督语音识别的方法,包括帧级特征表示和用于变长片段的声学词嵌入(AWE)。然而,自监督模型单独无法学习语言内容的完美分离,因为它们训练于优化间接目标。本工作中,我们尝试不同预训练自监督特征作为AWE模型输入,并展示它们在有监督框架下效果最佳。在英语上训练的模型可在无任何适配情况下迁移到其他语言,并优于仅在目标语言上训练的自监督模型。
引用
@article{arxiv.2301.01020,
title = {Supervised Acoustic Embeddings And Their Transferability Across Languages},
author = {Sreepratha Ram and Hanan Aldarmaki},
journal= {arXiv preprint arXiv:2301.01020},
year = {2023}
}
备注
Presented at ICNLSP 2022