StepAudio 2.5技术报告
图形学
2026-05-25 v1
摘要
统一的音频语言建模已成为现代语音系统中的热门趋势,旨在将大型语言模型的推理能力引入听觉任务。然而,现有的统一基础模型往往难以匹配面向自动语音识别(ASR)、文本转语音合成(TTS)和实时语音交互等任务的深度专用系统。弥合这一差距仍是开放的挑战。本报告介绍了StepAudio 2.5,这是一个统一的音频语言基础模型,在所有三个能力上均匹配或超越专用系统。我们并非将这些任务视为架构上不同的实体,而是基于文本与音频在多模态表征空间中的共享前提:一旦实现此共享,任务专业化便成为操作 regime 的问题:数据构建、优化目标和解码约束。循着这一洞见,我们将 post-training 范式从标准监督学习推进为基于任务导向的强化学习从人类反馈(RLHF),将其作为定义复杂优化目标的主要机制。我们利用这一以RLHF为中心的对齐方式,结合专业化解码,将共享的 backbone 塑造为三个不同的操作模式。具体而言,ASR分支通过可验证的多token解码提升转录效率;TTS分支通过基于偏好的RLHF和上下文丰富的监督实现可控且富有表现力的合成;实时分支则通过RLHF框架内的生成式奖励建模,实现低延迟且人格一致的对话。在标准基准上,StepAudio 2.5在ASR、TTS和实时任务上均取得最新SOTA成绩,表明单一的音频语言基础模型能够成功内化语音理解、生成和实时交互的 distinct 部署目标。
引用
@article{arxiv.2605.23462,
title = {Closing Trajectories: Equation-Free Cyclic Animation via Koopman Surrogates},
author = {Shixun Huang and Siyuan Chen and Yue Chang and Zhecheng Wang and Peter Yichen Chen},
journal= {arXiv preprint arXiv:2605.23462},
year = {2026}
}