中文

SAMU-XLSR:语义对齐的多模态话语级跨语言语音表示

计算与语言 2022-11-23 v1 机器学习 声音 音频与语音处理

摘要

我们提出 SAMU-XLSR:语义对齐的多模态话语级跨语言语音表示学习框架。与以往以声学帧(10-20毫秒)分辨率学习多语言上下文语音嵌入的语音表示学习工作不同,本工作专注于以句子(5-10秒)分辨率学习多模态(语音-文本)多语言语音嵌入,使得嵌入向量空间在不同语言间语义对齐。我们将最先进的多语言声学帧级语音表示学习模型 XLS-R 与语言无关的 BERT 句子嵌入(LaBSE)模型相结合,创建了话语级多模态多语言语音编码器 SAMU-XLSR。尽管我们仅使用多语言转录语音数据训练 SAMU-XLSR,其学习到的表示空间中涌现了跨语言语音-文本和语音-语音关联。为证实我们的主张,我们使用 SAMU-XLSR 语音编码器结合预训练的 LaBSE 文本句子编码器进行跨语言语音到文本翻译检索,并单独使用 SAMU-XLSR 进行跨语言语音到语音翻译检索。我们通过在多个数据集上执行若干跨语言文本和语音翻译检索任务来突出这些应用。

关键词

引用

@article{arxiv.2205.08180,
  title  = {SAMU-XLSR: Semantically-Aligned Multimodal Utterance-level Cross-Lingual Speech Representation},
  author = {Sameer Khurana and Antoine Laurent and James Glass},
  journal= {arXiv preprint arXiv:2205.08180},
  year   = {2022}
}