离散跨模态对齐实现零样本语音翻译
计算与语言
2022-10-19 v1 声音
音频与语音处理
摘要
端到端语音翻译(ST)旨在将源语言语音直接翻译为目标语言文本,而不生成中间转录。然而,端到端方法的训练依赖于平行 ST 数据,这类数据难以获取且成本高昂。幸运的是,用于自动语音识别(ASR)和机器翻译(MT)的监督数据通常更易获得,使得零样本语音翻译成为一个潜在方向。现有零样本方法未能将语音与文本两种模态对齐到共享语义空间,导致性能远差于有监督 ST 方法。为实现零样本 ST,我们提出一种新颖的离散跨模态对齐(DCMA)方法,其采用共享离散词汇空间来容纳并匹配语音与文本两种模态。具体而言,我们引入向量量化模块将语音与文本的连续表示离散化为有限组虚拟词元,并利用 ASR 数据将对应语音与文本映射到共享码本中的同一虚拟词元。如此,源语言语音可嵌入与源语言文本相同的语义空间,进而可通过 MT 模块转换为目标语言文本。在多个语言对上的实验表明,我们的零样本 ST 方法显著改进了 SOTA,甚至可与强有监督 ST 基线相媲美。
引用
@article{arxiv.2210.09556,
title = {Discrete Cross-Modal Alignment Enables Zero-Shot Speech Translation},
author = {Chen Wang and Yuchen Liu and Boxing Chen and Jiajun Zhang and Wei Luo and Zhongqiang Huang and Chengqing Zong},
journal= {arXiv preprint arXiv:2210.09556},
year = {2022}
}
备注
Accepted by the main conference of EMNLP 2022