HoliTok:一种连续整体语音分词,具备稳健的语音生成与理解双重能力
声音
2026-05-29 v1 人工智能
音频与语音处理
摘要
统一的语音基础模型需要一种既可被语言模型学习又可解码为高质量波形的整体语音分词空间。然而,现有的语音分词器往往无法同时满足这些要求,导致架构复杂度增加和训练设计更为复杂。我们提出 HoliTok,一种为统一的生成-理解建模设计的连续整体语音分词模型。HoliTok 将 48~kHz 语音编码为 25~Hz 长的 128 维潜在序列。它采用渐进式训练策略,既保持信号层面的保真度,又融合语义信息,同时保持强大的潜在可学习性。基于此分词,我们构建了一个统一的 AR+DiT 模型用于语音合成和识别,其中相同的潜在序列支持生成特定任务和统一生成-理解任务。实验表明,HoliTok 在竞争性的重构保真度方面表现良好,改进了高质量和可控合成的生成可学习性,并且在所评估的表示方法中,只有它在无需额外优化技巧的情况下能稳健地在统一的生成-理解架构中运行。这些结果表明,HoliTok 既是有效的语音分词器,也是统一语音语言建模的基础表示界面。代码已公开:https://github.com/bovod-sjtu/HoliTok。
引用
@article{arxiv.2605.29948,
title = {HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding},
author = {Bohan Li and Shi Lian and Hankun Wang and Yiwei Guo and Yu Xi and Zhihan Li and Da Zheng and Colin Zhang and Kai Yu},
journal= {arXiv preprint arXiv:2605.29948},
year = {2026}
}
备注
14 pages, 2 figures, 8 tables