StyleStream:实时零样图语音风格转换
声音
2026-02-24 v1 人工智能
摘要
语音风格转换旨在将输入语音转换为匹配目标说话人语音特征、方言和情感,核心挑战在于对语言内容与风格的解耦。虽然已有工作探索了这一问题,但转换质量仍有限,实时语音风格转换尚未得到解决。我们提出StyleStream,这是首个可流式零样图语音风格转换系统,实现了最先进的性能。StyleStream由两个组件构成:Destylizer去除风格属性而保留语言内容,Stylizer是一个基于扩散转换器(DiT)的风格化器,可依据参考语音重introduction目标风格。通过文本监督和高度受限的信息瓶颈实现鲁健的内容-风格解耦。该设计使我们能够实现完全非自回归架构,实现语音风格转换的实时处理,端到端延迟仅为1秒。样本和实时演示:https://berkeley-speech-group.github.io/StyleStream/。
引用
@article{arxiv.2602.20113,
title = {StyleStream: Real-Time Zero-Shot Voice Style Conversion},
author = {Yisi Liu and Nicholas Lee and Gopala Anumanchipalli},
journal= {arXiv preprint arXiv:2602.20113},
year = {2026}
}