Bagpiper:通过丰富描述解决开放式音频任务
计算与语言
2026-02-24 v2 声音
摘要
当前的音频基础模型通常依赖刚性、任务特定的监督,仅解决音频中的孤立因素,而非整体。在 contrast,人类智能以整体方式处理音频,无缝地将物理信号与抽象认知概念联系起来,以执行复杂任务。以此为哲学基础,我们引入 Bagpiper,一个规模为 8B 参数的音频基础模型,通过丰富描述 (rich captions) 解释物理音频,即包含封装信号中关键认知概念的全面自然语言描述 (如转录、音频事件)。通过在 6000 亿 token 的大规模语料上预训练,模型在原始音频与高层概念空间之间建立了稳健的双向映射。在微调期间,Bagpiper 采用描述-处理工作流程,模拟中间认知推理步骤,以无需任务特定先验的方式解决多样化任务。实验表明,Bagpiper 在音频理解任务上超越 Qwen-2.5-Omni,在 MMAU 和 AIRBench 上表现更佳,在生成任务上超越 CosyVoice3 和 TangoFlux,能够合成任意组合的语音、音乐和音效。令人惊讶的是,Bagpiper 是已知首个实现音频通用理解与生成统一的工作。模型、数据和代码均可在 Bagpiper 主页获取。
引用
@article{arxiv.2602.05220,
title = {Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions},
author = {Jinchuan Tian and Haoran Wang and Bo-Hao Su and Chien-yu Huang and Qingzheng Wang and Jiatong Shi and William Chen and Xun Gong and Siddhant Arora and Chin-Jou Li and Masao Someki and Takashi Maekaku and Keita Goto and Yusuke Shinohara and Jin Sakuma and Chao-Han Huck Yang and Shinji Watanabe},
journal= {arXiv preprint arXiv:2602.05220},
year = {2026}
}