中文

转写、翻译还是音译:口语语言模型中间表示的探究

计算与语言 2025-10-20 v2

摘要

将语音与大型语言模型(LMs)集成的口语语言模型(SLMs)依赖模态适配器(MAs)将语音编码器的输出映射为解码器LM可理解的表示。然而,对于这些关键的MAs如何转换表示,我们知之甚少。在此,我们考察了三个SLMs(SALMONN、Qwen2-Audio 和 Phi-4-Multimodal-Instruct)中的MA输出表示。通过寻找最接近MA表示的解码器LM词元,我们揭示了MA表示的两种策略。对于使用 Whisper 编码器的模型,MAs 似乎使用基于英语的中间语来表示输入的含义,使其能够处理指令微调中未见过的语言。对于不使用该编码器的模型,如 Phi-4-Multimodal-Instruct,MAs 则表示输入的语音,但以英语单词表达。我们假设,出现哪种情况取决于语音编码器是仅针对语音识别训练,还是也针对翻译训练。

关键词

引用

@article{arxiv.2510.02569,
  title  = {Transcribe, Translate, or Transliterate: An Investigation of Intermediate Representations in Spoken Language Models},
  author = {Tolúlopé Ògúnrèmí and Christopher D. Manning and Dan Jurafsky and Karen Livescu},
  journal= {arXiv preprint arXiv:2510.02569},
  year   = {2025}
}

备注

ASRU 2025