Step-Audio-EditX 技术报告
计算与语言
2025-11-20 v2 人工智能
人机交互
声音
音频与语音处理
摘要
我们提出 Step-Audio-EditX,这是首个基于大型语言模型(LLM)的开源音频模型,卓越地实现了包容情感、说话风格和非语言信息的表达性和迭代音频编辑,同时具备强大的零样本文本到语音(TTS)能力。我们的核心创新在于仅利用大边缘合成数据,规避了基于嵌入的先验或辅助模块的需求。这种大边缘学习方法实现了迭代控制和跨语音的高表达性,标志着从传统表示级别解耦的关注点进行的根本性转变。评估结果表明,Step-Audio-EditX 在情感编辑及其他细粒度控制任务方面超越了 MiniMax-2.6-hd 和 Doubao-Seed-TTS-2.0。
引用
@article{arxiv.2511.03601,
title = {Step-Audio-EditX Technical Report},
author = {Chao Yan and Boyong Wu and Peng Yang and Pengfei Tan and Guoqiang Hu and Li Xie and Yuxin Zhang and Xiangyu and Zhang and Fei Tian and Xuerui Yang and Xiangyu Zhang and Daxin Jiang and Shuchang Zhou and Gang Yu},
journal= {arXiv preprint arXiv:2511.03601},
year = {2025}
}