统一音频模式:感知导向的 AudioLLM
计算与语言
2026-04-15 v1 声音
摘要
近期音频大语言模型 (AudioLLM) 在复杂推理任务中表现出惊人的能力,但在细粒度声学感知方面始终落后于人类。我们将这一差距归因于面向语音识别 (ASR) 的训练,这种训练提供精确的语言目标,却隐式地教会模型抑制并将语音之外的线索和声学事件视为噪声。为此,我们提出统一音频模式 (Unified Audio Schema, UAS),这是一种整体且结构化的监督框架,将音频信息组织为三个显式组件——转录、非语言特征和非语言事件——并以统一的 JSON 格式呈现。该设计在不牺牲启用推理的紧密音频-文本对齐能力的前提下,实现了对声学的全面覆盖。我们通过将其应用于离散和连续 AudioLLM 架构来验证这种监督策略的有效性。在 MMSU、MMAR 和 MMAU 上的大规模实验表明,UAS-Audio 在相同规模的 SOTA 模型上在 MMSU 上提升了 10.9% 的细粒度感知能力,同时保持了稳健的推理能力。我们的代码和模型已公开发布于 https://github.com/Tencent/Unified_Audio_Schema。
引用
@article{arxiv.2604.12506,
title = {Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs},
author = {Linhao Zhang and Yuhan Song and Aiwei Liu and Chuhan Wu and Sijun Zhang and Wei Jia and Yuan Liu and Houfeng Wang and Xiao Zhou},
journal= {arXiv preprint arXiv:2604.12506},
year = {2026}
}
备注
Accepted to ACL 2026 Findings