中文

Crab$^{+}$: 面向统一音视频场景理解的可扩展模型 with 显式合作

计算机视觉与模式识别 2026-03-05 v1 人工智能 多媒体

摘要

开发面向统一场景理解的音视频大语言模型(AV-LLM)是多模态智能的关键任务。虽然指令调谐使预训练模型具备多任务能力,但我们注意到常规的多任务统一方法常常出现严重的负迁移,其中近 55% 的任务相对于单任务训练会出现性能下降。我们将此现象归因于音视频任务的异质性,具体表现为不同的任务粒度和差异化的能力需求,这些差异在联合训练下导致负干扰。为解决此问题,我们提出 Crab+^{+},一个可扩展且统一的音视频场景理解模型,通过数据和模型层面的显式合作来解决任务异质性问题。在数据层面,我们引入 AV-UIE v2,一个包含约 222K 样本、覆盖 17 个数据集和 7 个任务的综合性音视频统一指令调谐数据集,使模型能够捕获不同粒度上的跨任务关系。在模型层面,我们设计统一的接口以对齐异构任务表述,提出交互感知 LoRA(I-LoRA),通过动态路由显式建模任务间关系,以协调不同的音视频交互模式,缓解参数干扰。大量实验表明,Crab+^{+} 覆盖的任务范围超过现有统一模型,同时在各种基准上 outperform 专门化模型。我们成功逆转了负迁移趋势,在近 88% 的任务中实现正向迁移,即多任务学习超越单任务基线。这些结果在 diverse AV-LLM paradigm 中均得到验证,并通过深入可视化实现,使 Crab+^{+} 成为实现全方位音视频场景理解的稳健步骤。

关键词

引用

@article{arxiv.2603.04128,
  title  = {Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation},
  author = {Dongnuan Cai and Henghui Du and Chang Zhou and Xi Chen and Dan Guo and Hongyuan Zhang and Xuelong Li and Di Hu},
  journal= {arXiv preprint arXiv:2603.04128},
  year   = {2026}
}