中文

口语语言模型全景:综合综述

计算与语言 2026-04-08 v2 声音 音频与语音处理

摘要

口语语言处理领域正经历从训练定制的、任务特定模型向使用和优化作为通用语音处理系统的口语语言模型的转变。这一趋势类似于(文本)自然语言处理领域向通用语言模型发展的进程。口语语言模型包括“纯”语音语言模型——对标记化语音序列分布的模型——以及将语音编码器与文本语言模型相结合的模型,通常包括口语和书面输入或输出。该领域的工作非常多样化,具有一系列术语和评估设置。本文旨在通过结合领域演进的背景,对近期工作进行统一的文献综述,以增进对口语语言模型的理解。我们的综述按模型架构、训练和评估选择对该领域的工作进行分类,并描述了一些关键挑战和未来工作方向。

关键词

引用

@article{arxiv.2504.08528,
  title  = {On The Landscape of Spoken Language Models: A Comprehensive Survey},
  author = {Siddhant Arora and Kai-Wei Chang and Chung-Ming Chien and Yifan Peng and Haibin Wu and Yossi Adi and Emmanuel Dupoux and Hung-Yi Lee and Karen Livescu and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2504.08528},
  year   = {2026}
}

备注

Published in Transactions on Machine Learning Research