中文

理解共享语音-文本表示

计算与语言 2023-05-01 v1 机器学习 声音 音频与语音处理

摘要

近年来,人们开发了多种通过将文本融入端到端模型来训练语音模型的方法,其中 Maestro 推动了自动语音识别(ASR)和语音翻译(ST)的最先进性能。在本文中,我们通过两类分析增进对所得共享语音-文本表示的理解。首先,我们考察了无语音领域自适应的极限,发现用于语音-文本对齐的特定语料时长模型是学习共享语音-文本表示最重要的组成部分。其次,我们对比了单模态(语音或文本)编码器的激活与共享编码器的激活之间的相似性。我们发现,共享编码器学习到的语音-文本表示比单模态编码器更加紧凑且重叠度更高。我们推测,这在一定程度上解释了 Maestro 共享语音-文本表示的有效性。

关键词

引用

@article{arxiv.2304.14514,
  title  = {Understanding Shared Speech-Text Representations},
  author = {Gary Wang and Kyle Kastner and Ankur Bapna and Zhehuai Chen and Andrew Rosenberg and Bhuvana Ramabhadran and Yu Zhang},
  journal= {arXiv preprint arXiv:2304.14514},
  year   = {2023}
}

备注

Accepted at ICASSP 2023, camera ready