交错语义、声学与文本标记的离散音频基石模型的规模化
声音
2026-02-19 v1 计算与语言
音频与语音处理
摘要
当前音频语言模型主要是文本优先的,要么扩展预训练的文本大语言模型,要么依赖语义-only 音频标记,限制了通用音频建模。本文提出了一项系统性经验研究,探讨了原生音频基石模型,这些模型对音频在规模上应用下一个标记预测,联合建模语义内容、声学细节和文本,以支持通用音频生成和跨模态能力。我们为构建此类模型提供了全面的经验见解:(1)我们系统性地检讨设计选择——数据来源、文本混合比率和标记组成——确立了一个经过验证的训练配方。(2)我们通过在 至 FLOPs 范围内对 64 个模型进行 IsoFLOP 分析,进行了离散音频模型的首次比例研究,发现最佳数据增长速度为 最佳模型规模的 1.6 倍。(3)我们将这些经验应用于训练 SODA(Scaling Open Discrete Audio),该模型在 5000 亿标记上从 1.35 亿到 40 亿参数规模进行训练,比较了与我们的比例预测以及现有模型。SODA 作为多样化音频/文本任务的灵活基座——我们通过微调实现语音保留的语音到语音翻译,展示了该统一架构。
引用
@article{arxiv.2602.16687,
title = {Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens},
author = {Potsawee Manakul and Woody Haosheng Gan and Martijn Bartelds and Guangzhi Sun and William Held and Diyi Yang},
journal= {arXiv preprint arXiv:2602.16687},
year = {2026}
}