中文

为何语音语言模型难以生成语义连贯的输出?——一种模态演化视角

音频与语音处理 2026-01-28 v2 计算与语言 声音

摘要

尽管基于文本的大型语言模型表现出人类水平的写作能力和卓越的智能,但语音语言模型(SLMs)仍然难以生成语义连贯的输出。可能的原因包括:(A)语音标记主要提供语音信息而非语义信息;(B)语音序列的长度远大于文本序列;(C)语音韵律信息(如语调)引入了额外的复杂性和变异性。本文通过以演化方式将模态从文本转换为语音,分别探讨了上述三个关键因素的影响。我们的发现表明,这三个因素的影响程度各不相同。因素 A 对结果影响较小,因素 B 对语法和语义建模影响较为明显,而因素 C 的影响尤其在基础词汇建模中最为显著。基于这些发现,我们提供了训练 SLMs 面临的独特挑战的见解,并指出了开发更有效的端到端 SLMs 的路径。

关键词

引用

@article{arxiv.2412.17048,
  title  = {Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective},
  author = {Hankun Wang and Haoran Wang and Yiwei Guo and Zhihan Li and Chenpeng Du and Kai Yu},
  journal= {arXiv preprint arXiv:2412.17048},
  year   = {2026}
}

备注

5 pages, 3 figures, 4 tables. Accepted to IEEE ICASSP 2026