中文

以数据为中心改进语音语言预训练的启示

音频与语音处理 2025-10-27 v1 计算与语言 机器学习

摘要

口语问答(SQA)是构建有用且交互式人工智能系统的核心能力。近期,一些语音语言模型(SpeechLM)已发布,其特别关注提升SQA性能。然而,由于缺乏对预训练数据处理和整理的受控消融研究,尽管在其他数据模态的类似研究中取得了显著进展,但理解哪些因素导致了性能提升仍然具有挑战性。在这项工作中,我们通过对预训练SpeechLM进行以数据为中心的探索来弥补这一差距。我们聚焦于语音语言预训练数据基础的三个研究问题:(1)如何处理原始网络爬取的音频内容以用于语音文本预训练,(2)如何构建合成预训练数据集以增强网络爬取数据,以及(3)如何将(文本,音频)片段交错排列成训练序列。我们将受控数据消融研究的见解应用于预训练一个名为SpeLangy的38亿参数SpeechLM,该模型在绝对性能上比大3倍的模型高出10.2%。我们希望我们的发现能强调有效数据整理对语音语言预训练的影响,并指导SpeechLM未来以数据为中心的探索。

关键词

引用

@article{arxiv.2510.20860,
  title  = {Data-Centric Lessons To Improve Speech-Language Pretraining},
  author = {Vishaal Udandarao and Zhiyun Lu and Xuankai Chang and Yongqiang Wang and Violet Z. Yao and Albin Madapally Jose and Fartash Faghri and Josh Gardner and Chung-Cheng Chiu},
  journal= {arXiv preprint arXiv:2510.20860},
  year   = {2025}
}

备注

Tech Report