ALMTokenizer: 一种面向音频语言模型的低比特率且语义丰富的音频编码器标记器
声音
2025-04-15 v1
摘要
近期音频语言模型的进展凸显了音频标记化这一关键作用,即将音频信号转换为离散标记,从而便于将语言模型架构应用于音频领域。本研究引入ALMTokenizer,一种新的低比特率且语义丰富的音频编码器标记器。以往方法(如Encodec)通常将单个音频帧编码为离散标记,而不考虑跨帧上下文信息。与这些方法不同,我们提出一种基于查询的压缩策略,通过显式建模跨帧的上下文信息,以一组可学习的查询标记捕获整体信息。这种设计不仅使编码器能够捕获更多语义信息,还能以更少的标记序列对音频信号进行编码。此外,为增强音频编码器中的语义信息,我们引入以下三种技术:(1)掩码自编码器(MAE)损失;(2)基于语义先验的向量量化;(3)自回归(AR)预测损失。结果表明,ALMTokenizer在保持较低比特率的同时,以竞争的重建性能超过最先进的方法;在相同的音频语言模型框架下,ALMTokenizer在音频理解和生成任务中超越了以往的标记器。
引用
@article{arxiv.2504.10344,
title = {ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling},
author = {Dongchao Yang and Songxiang Liu and Haohan Guo and Jiankun Zhao and Yuanyuan Wang and Helin Wang and Zeqian Ju and Xubo Liu and Xueyuan Chen and Xu Tan and Xixin Wu and Helen Meng},
journal= {arXiv preprint arXiv:2504.10344},
year = {2025}
}