FlashLabs Chroma 1.0:面向实时端到端语音对话的带个人化语音克隆模型
声音
2026-01-19 v1 计算与语言
音频与语音处理
摘要
最近的端到端语音对话系统利用语音标记化器和神经音频编解码器,使大型语言模型能够直接处理离散语音表示。然而,这些模型往往表现出有限的说话人身份保留能力,限制了个人化语音交互。在本工作中,我们提出Chroma 1.0,这是首个实现低延迟交互和高保真度个人化语音克隆的开源、实时、端到端语音对话模型。Chroma通过一种交错的文本-音频标记时间表 (1:2) 实现亚秒级端到端延迟,支持流式生成,同时在多轮对话中保持高质量的个人化语音合成。我们的实验结果表明,Chroma在说话人相似度方面相对于人类基准实现了10.96%的相对改进,实时因子 (RTF) 为0.43,同时保持强大的推理和对话能力。我们的代码和模型已公开于 https://github.com/FlashLabs-AI-Corp/FlashLabs-Chroma 和 https://huggingface.co/FlashLabs/Chroma-4B 。
引用
@article{arxiv.2601.11141,
title = {FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning},
author = {Tanyu Chen and Tairan Chen and Kai Shen and Zhenghua Bao and Zhihui Zhang and Man Yuan and Yi Shi},
journal= {arXiv preprint arXiv:2601.11141},
year = {2026}
}