中文

Fish Audio S2 技术报告

声音 2026-03-12 v2 人工智能 计算与语言

摘要

我们介绍 Fish Audio S2,这是一个开源的文本转语音系统,特点是多说话人、多轮生成,最重要的是通过自然语言描述实现指令跟随控制。为扩大训练规模,我们开发了一套多阶段训练配方,并构建了涵盖视频字幕和语音字幕、语音质量评估以及奖励建模的分阶段数据管道。为推动开源 TTS 的前沿,我们发布了模型权重、微调代码以及基于 SGLang 的推理引擎。该推理引擎支持流式推理,实时因子(RTF)为 0.195,首次音频生成时间低于 100 毫秒。我们的代码和权重已在 GitHub(https://github.com/fishaudio/fish-speech)和 Hugging Face(https://huggingface.co/fishaudio/s2-pro)上提供。我们强烈鼓励读者访问 https://fish.audio 尝试自定义语音。

关键词

引用

@article{arxiv.2603.08823,
  title  = {Fish Audio S2 Technical Report},
  author = {Shijia Liao and Yuxuan Wang and Songting Liu and Yifan Cheng and Ruoyi Zhang and Tianyu Li and Shidong Li and Yisheng Zheng and Xingwei Liu and Qingzheng Wang and Zhizhuo Zhou and Jiahua Liu and Xin Chen and Dawei Han},
  journal= {arXiv preprint arXiv:2603.08823},
  year   = {2026}
}