中文

LoSATok:用于跨域音频理解与生成的低维语义-声学分词器

音频与语音处理 2026-05-28 v1 人工智能 声音

摘要

音频分词器是统一音频理解与生成的基础。理解需要高层语义,而生成则需要语义和声学细节。现有的统一分词器将两者共同编码到高维连续潜变量中,这增加了扩散变换器(DiT)在生成时的建模负担。我们提出 LoSATok,一种用于跨域音频理解与生成的低维音频分词器。受 1280 维语义编码器特征可压缩这一观察的启发,我们引入了一个语义瓶颈,将其压缩至 128 维,并通过所提出的时间关系损失进行正则化,以保持时间特征一致性。我们进一步设计了一种双层语义监督方法,利用高维和低维语义信号,使分词器能够在紧凑的潜空间中联合捕获语义和声学细节。在语音、音乐和通用音频上的实验表明,SemBo 保持了强大的低维语义能力,LoSATok 在与几种语义表示相比时保持了有竞争力的理解性能,同时在语音、音乐和音频生成上持续提升了 DiT 的建模性能。这些结果表明,LoSATok 的低维表示能够有效支持音频理解与生成。我们的代码见 https://github.com/wxzyd123/LoSATok。

关键词

引用

@article{arxiv.2605.27840,
  title  = {LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation},
  author = {Zhisheng Zhang and Xiang Li and Yixuan Zhou and Jing Peng and Guoyang Zeng and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2605.27840},
  year   = {2026}
}