释放 GPT 的时空推理能力:无需训练的音频与语言参考视频目标分割
计算机视觉与模式识别
2024-12-24 v2
摘要
本文提出了一种名为 Audio-Language-Referenced SAM 2 (AL-Ref-SAM 2) 的管道,用于探索面向音频与语言参考视频目标分割(即 AVS 与 RVOS 任务)的无需训练范式。直观的做法利用 GroundingDINO 从单帧中识别目标对象,再利用 SAM 2 对识别出的对象在整个视频中进行分割,但由于缺乏对视频语境的探索,鲁棒性较差。因此,在 AL-Ref-SAM 2 管道中,我们提出了一种 novel 的 GPT 辅助枢轴选择 (GPT-PS) 模块,用于指示 GPT-4 执行两步时空推理,以依次选择枢轴帧和枢轴框,从而为 SAM 2 提供高质量的初始对象提示。在 GPT-PS 中,设计了两个任务特定的链式思考提示词,通过引导 GPT 对视频与参考信息进行全面理解来 unleash GPT 的时空推理能力。进一步地,我们提出了一种语言绑定参考统一 (LBRU) 模块,将音频信号转换为语言格式的参考,从而在同一管道中统一 AVS 与 RVOS 任务的格式。大量实验表明,我们的无需训练 AL-Ref-SAM 2 管道在两项任务上的性能可与甚至优于 fully-supervised 微调方法。代码已公开:https://github.com/appletea233/AL-Ref-SAM2。
引用
@article{arxiv.2408.15876,
title = {Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation},
author = {Shaofei Huang and Rui Ling and Hongyu Li and Tianrui Hui and Zongheng Tang and Xiaoming Wei and Jizhong Han and Si Liu},
journal= {arXiv preprint arXiv:2408.15876},
year = {2024}
}
备注
Accepted by AAAI 2025