Whisper-AuT:用于高效音频-LLM训练的领域适应音频编码器
声音
2026-04-14 v1
摘要
音频native大语言模型(audio-LLM)常使用Whisper作为音频编码器。然而,Whisper仅在语音数据上进行训练,对于音乐和环境声产生较弱的表示。这迫使下游音频-LLM通过在大规模非语音数据上的 extensive 训练来弥补。我们提出Whisper-AuT,通过在约2000万样本的精选混合数据(语音80%、环境声10%、音乐10%)上对Whisper-large-v3进行领域适应,获得领域适应音频编码器。整个编码器-解码器进行端到端训练,采用序列到序列说明学习目标;随后丢弃解码器,仅保留编码器。线性探针评估显示,与原始Whisper-large-v3编码器相比,Whisper-AuT在ESC-50(环境声)上提升+23.0%,在GTZAN(音乐主题)上提升+5.0%,在Speech Commands(关键词探测)上提升+0.7%。Whisper-AuT旨作为Whisper在音频-LLM架构中的即插即用替换品,目标是通过提供更强的非语音领域的初始音频表示,降低下游训练成本。
引用
@article{arxiv.2604.10438,
title = {Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training},
author = {Jielin Qiu and Ming Zhu and Wenting Zhao and Zhiwei Liu and Liangwei Yang and Zixiang Chen and Roshan Ram and Akshara Prabhakar and Juntao Tan and Rithesh Murthy and Shelby Heinecke and Caiming Xiong and Silvio Savarese and Huan Wang},
journal= {arXiv preprint arXiv:2604.10438},
year = {2026}
}