中文

为什么你的分词器在信息融合中失败:用于视频增强音频分词的时间感知预量化融合

音频与语音处理 2026-04-15 v1 声音

摘要

音频分词已成为端到端音频语言模型中的关键组成部分,能够为音频理解和生成任务实现高效的离散表示学习。然而,由于单模态限制,现有的音频分词器在理解任务中面临根本性限制,特别是当音频信号包含模糊或不完整信息时。虽然引入额外的模态信息可以显著增强音频理解,但当前的多模态融合方法无一例外地会降低重建质量。这种退化对于需要高保真音频生成能力的端到端音频系统是不可接受的。在这项工作中,我们研究了视频增强音频分词中重建质量退化的根本原因,并提出了三个关键发现。首先,分词器架构中融合的位置对于保持重建质量至关重要。其次,我们表明对比学习虽然在连续表示融合中有效,但不适用于离散分词器,因为它无法提升下游任务性能。第三,虽然特征维度融合方法取得了一定成功,但我们发现,在“区分性特征”概念的指导下,沿时间轴进行融合能产生显著更好的结果。基于这些见解,我们引入了用于视频增强音频分词的时间感知预量化融合,这是第一个成功将视觉信息集成到音频分词器架构中同时保持重建保真度的方法。与仅音频分词器和已建立的多模态融合基线相比,我们的方法不仅保持了高保真重建,而且在下游理解任务上取得了更优越的性能。

关键词

引用

@article{arxiv.2604.12145,
  title  = {Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization},
  author = {Xiangyu Zhang and Benjamin John Southwell and Siqi Pan and Xinlei Niu and Beena Ahmed and Julien Epps},
  journal= {arXiv preprint arXiv:2604.12145},
  year   = {2026}
}