中文

Speech-Omni-Lite:面向视觉-语言模型的便携式语音接口

音频与语音处理 2026-03-11 v1

摘要

虽然大规模 Omni 模型在各种模态上已展现出惊人的能力,但其卓越性能严重依赖海量多模态数据并产生巨大的计算成本。本工作引入 Speech-Omni-Lite,一个高性价比的框架,用于扩展预训练的视觉-语言 (VL) 主干网络,同时完全保留主干网络的视觉-语言性能。具体而言,VL 主干网络配备两个轻量级、可即插即用的模块:语音投影器和语音 token 生成器,同时保持 VL 主干网络完全冻结。为缓解口语问答语料稀缺问题,提出一种低成本的数据构建策略,从现有的 ASR 语音-文本对生成 Question-Text Answer-Text-Speech (QTATS) 数据,促进有效的语音生成训练。实验结果表明,即便仅使用数千小时的语音训练数据,Speech-Omni-Lite 也能实现出色的口语问答性能,相当于在数百万小时语音数据上训练的 Omni 模型。此外,所学的语音模块在不同 VL 主干网络之间表现出强大的可迁移性。

关键词

引用

@article{arxiv.2603.09627,
  title  = {Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models},
  author = {Dehua Tao and Xuan Luo and Daxin Tan and Kai Chen and Lanqing Hong and Jing Li and Ruifeng Xu and Xiao Chen},
  journal= {arXiv preprint arXiv:2603.09627},
  year   = {2026}
}