中文

Whisper风格语音编码器中的语言在语音与语义上实现对齐

计算与语言 2026-04-07 v2

摘要

预训练语言模型中的跨语言对齐实现了跨语言的知识迁移。基于使用表征相似性的口语翻译检索,已有研究报道在Whisper风格的语音编码器中存在类似的对齐。然而,先前的工作并未控制等价话语之间的语音重叠,这可能人为地支持检索。我们进行了发音控制实验,以测试跨语言对齐是否源于语义而非语音相似性。结果表明,在以语音翻译为目标训练的编码器的最终层中,在没有语音线索的情况下,口语翻译检索仍远高于随机水平,这在额外接受翻译训练的模型中最为明显。我们进一步测试了编码器的提前退出,以诱导我们假设与特定语言语义联系较少的表征。这些实验确实揭示了在训练期间未见过的低资源语言上的自动语音识别性能提升。

关键词

引用

@article{arxiv.2505.19606,
  title  = {Languages in Whisper-Style Speech Encoders Align Both Phonetically and Semantically},
  author = {Ryan Soh-Eun Shim and Domenico De Cristofaro and Chengzhi Martin Hu and Alessandro Vietti and Barbara Plank},
  journal= {arXiv preprint arXiv:2505.19606},
  year   = {2026}
}

备注

Submitted to Interspeech 2026