中文

COSTA:使用对齐语音-文本交错进行代码切换语音翻译

计算与语言 2024-06-18 v1 机器学习 声音 音频与语音处理

摘要

代码切换是多语言社会中常见的语言现象,如印度。针对印度语言代码切换语音的语音到文本翻译面临数据稀缺的挑战。本文聚焦于将代码切换语音翻译为英文文本的 spoken translation(ST)问题。我们提出一种新型 end-to-end 模型架构 COSTA,该架构基于预训练的自动语音识别(ASR)和机器翻译(MT)模块(这些模块针对许多语言都更广泛可用)。通过对齐交错方案融合语音和 ASR 文本表示,并输入到预训练的 MT 模块中;随后整个管道使用人工创建的 ST 数据进行 end-to-end 训练。我们还发布了一个新的评估基准,涵盖孟加拉-英、印地-英、马拉拉-英和泰卢-英语音频到英文文本的翻译。COSTA 在多个竞争性级联和 end-to-end 多模态基线中显著优于其中一些,提升了最高可达 3.5 BLEU 分。

关键词

引用

@article{arxiv.2406.10993,
  title  = {CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving},
  author = {Bhavani Shankar and Preethi Jyothi and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2406.10993},
  year   = {2024}
}