中文

DashengTokenizer:单层即足以实现统一的音频理解与生成

声音 2026-03-27 v2 音频与语音处理

摘要

本文介绍 DashengTokenizer——一种为联合理解与生成任务而设计的连续音频标记器。不同于传统方法需先训练声学标记器再集成冻结语义知识的范式,我们的方法则颠覆这一思路:我们利用冻结语义特征并注入声学信息。在覆盖22种不同任务的线性评估中,我们的方法在显著优于前述音频编解码器和音频编码器基线的同时,保持具竞争力的音频重构质量。值得注意的是,我们证明声学注入可提升诸如语音情感识别、音乐理解及声学场景分类等任务性能。我们进一步评估了该标记器在文本到音频(TTA)、文本到音乐(TTM)及语音增强(SE)上的生成性能。我们的做法在 TTA 与 TTM 任务上超越基于变分自编码器(VAE)的标准方法,而在 SE 任务上的有效性进一步凸显其作为通用音频编码器的潜力。最后,我们的结果挑战了 VAE 架构是音频合成必备条件的既有假设。模型 checkpoint 可在 https://huggingface.co/mispeech/dashengtokenizer 获得。

关键词

引用

@article{arxiv.2602.23765,
  title  = {DashengTokenizer: One layer is enough for unified audio understanding and generation},
  author = {Heinrich Dinkel and Xingwei Sun and Gang Li and Jiahao Mei and Yadong Niu and Jizhong Liu and Xiyang Li and Yifan Liao and Jiahao Zhou and Junbo Zhang and Jian Luan},
  journal= {arXiv preprint arXiv:2602.23765},
  year   = {2026}
}

备注

Added ACAVCaps reference