中文

面向端到端语音翻译的模态空间软对齐

计算与语言 2023-12-19 v1 人工智能 声音 音频与语音处理

摘要

端到端语音翻译(ST)旨在将语音转换为目标文本,并在一个统一模型中完成。语音与文本模态之间的固有差异常常阻碍有效的跨模态和跨语言迁移。现有方法通常采用单个语音和文本片段的硬对齐(H-Align),这可能会降低文本表示的质量。为解决此问题,我们引入了软对齐(S-Align),利用对抗训练来对齐两种模态的表示空间。S-Align 创建了一个模态不变空间,同时保留了各模态的质量。在 MuST-C 数据集上对三种语言的实验表明,S-Align 在多项任务上优于 H-Align,并提供了可与专用翻译模型相媲美的翻译能力。

关键词

引用

@article{arxiv.2312.10952,
  title  = {Soft Alignment of Modality Space for End-to-end Speech Translation},
  author = {Yuhao Zhang and Kaiqi Kou and Bei Li and Chen Xu and Chunliang Zhang and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2312.10952},
  year   = {2023}
}

备注

Accepted to ICASSP2024