UniAV:面向多任务视频事件定位的统一视听感知
计算机视觉与模式识别
2025-11-20 v3 多媒体
声音
音频与语音处理
摘要
视频事件定位任务包括时序动作定位(TAL)、声音事件检测(SED)和视听事件定位(AVEL)。现有方法往往过度专门化于单个任务,忽略了这些不同事件对于完整理解视频内容的同等重要性。在本研究中,我们旨在开发一个统一框架,共同解决 TAL、SED 和 AVEL 任务,以促进整体的视频理解。然而,这极具挑战性,因为不同任务侧重于不同的事件特征,且现有特定任务数据集之间存在显著差异(规模/领域/时长)。采用简单的多任务策略会导致不理想的结果。为解决该问题,我们引入了 UniAV,一个统一视听感知网络,以有效地学习并在任务和模态间共享互惠知识。具体而言,我们提出了一个统一的视听编码器,从多个时间尺度为所有任务的视频导出通用表征。同时,设计了特定任务专家以捕获每个任务独有的特定知识。此外,我们没有使用单独的预测头,而是通过利用语义对齐的任务提示开发了一个新颖的统一语言感知分类器,使我们的模型能够灵活定位跨任务的各类实例,并具备定位新类别的出色开集能力。大量实验表明,UniAV 凭借其统一架构,在所有三个任务上均显著优于单任务模型和简单的多任务基线。在 ActivityNet 1.3、DESED 和 UnAV-100 基准上,与最先进的特定任务方法相比,其取得了更优或持平的性能。
引用
@article{arxiv.2404.03179,
title = {UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization},
author = {Tiantian Geng and Teng Wang and Jinming Duan and Yanfu Zhang and Weili Guan and Feng Zheng and Ling shao},
journal= {arXiv preprint arXiv:2404.03179},
year = {2025}
}
备注
Published on IEEE TPAMI