中文

面向查询的音频-视觉认知网络用于时刻检索、分割与步骤描述

计算机视觉与模式识别 2024-12-19 v1 人工智能 计算与语言

摘要

视频已成为互联网上广受欢迎的多媒体格式。为了更好地理解视频内容,一个新课题HIREST被提出,包括视频检索、时刻检索、时刻分割和步骤描述。开创性工作选择基于预训练CLIP的模型进行视频检索,并将其作为特征提取器,以多任务学习范式解决其他三个具有挑战性的任务。然而,由于忽略了跨模态的层次结构和关联关系,该工作难以学习用户偏好内容的全面认知。本文中,受从浅到深原则的指导,我们提出了一种面向查询的音频-视觉认知(QUAG)网络,为时刻检索、分割和步骤描述构建可靠的多模态表示。具体来说,我们首先设计模态协同感知,通过建模视觉和音频模态之间的全局对比对齐和局部细粒度交互,来获取丰富的音频-视觉内容。然后,我们设计了面向查询的认知,利用深层查询对浅层音频-视觉表示进行时间-通道过滤。这可以认知用户偏好的内容,从而为三个任务获得面向查询的音频-视觉表示。大量实验表明,QUAG在HIREST上达到了最先进的结果。此外,我们在基于查询的视频摘要任务上测试了QUAG,并验证了其良好的泛化能力。

关键词

引用

@article{arxiv.2412.13543,
  title  = {Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning},
  author = {Yunbin Tu and Liang Li and Li Su and Qingming Huang},
  journal= {arXiv preprint arXiv:2412.13543},
  year   = {2024}
}

备注

Accepted by AAAI 2025