超越固定帧率:动态字符对齐的语音分词化
机器学习
2026-02-05 v2 人工智能
声音
摘要
神经音频编解码器是现代对话式语音技术的核心,它将连续的语音转换为可由 LLM 处理的离散标记序列。然而,现有的编解码器通常以固定帧率运行,在时间上均匀分配标记,产生不必要长的序列。在这项工作中,我们引入了 DyCAST,一种动态字符对齐的语音分词器,它通过软字符级对齐和显式时长建模实现了可变帧率分词化。DyCAST 在训练过程中学习将标记与字符级语言单元关联起来,并支持无对齐推理,在解码时可直接控制标记时长。为了在低帧率下提高语音再合成质量,我们进一步引入了一种检索增强解码机制,该机制在不增加比特率的情况下提高了重建保真度。实验表明,与固定帧率编解码器相比,DyCAST 在使用显著更少标记的情况下,实现了具有竞争力的语音再合成质量和下游性能。代码和检查点将在 https://github.com/lucadellalib/dycast 公开发布。
引用
@article{arxiv.2601.23174,
title = {Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization},
author = {Luca Della Libera and Cem Subakan and Mirco Ravanelli},
journal= {arXiv preprint arXiv:2601.23174},
year = {2026}
}
备注
18 pages, 3 figures