T5lephone:通过音素级 T5 桥接语音与文本自监督模型用于口语理解
计算与语言
2022-11-02 v1 声音
音频与语音处理
摘要
在口语理解(SLU)中,一种自然的解决方案是拼接预训练语音模型(如 HuBERT)与预训练语言模型(PLM,如 T5)。大多数先前工作使用基于子词分词的预训练语言模型。然而,输入单元的粒度会影响语音模型输出与语言模型输入的对齐,且基于字符分词的 PLM 尚未得到充分探索。在这项工作中,我们深入研究了具有不同分词策略的 PLM 如何影响口语理解任务,包括口语问答(SQA)和语音翻译(ST)。我们进一步扩展该思路创建了 T5lephone(发音同 telephone),这是 T5 的一个变体,使用音素化文本进行预训练。我们用现有 PLM 初始化 T5lephone,并以相对轻量的计算资源对其进行预训练。我们在 NMSQA 上达到了最先进水平,且 T5lephone 模型在端到端 SQA 和 ST 上超越了使用其他类型单元的 T5。
引用
@article{arxiv.2211.00586,
title = {T5lephone: Bridging Speech and Text Self-supervised Models for Spoken Language Understanding via Phoneme level T5},
author = {Chan-Jan Hsu and Ho-Lam Chung and Hung-yi Lee and Yu Tsao},
journal= {arXiv preprint arXiv:2211.00586},
year = {2022}
}