多模态大语言模型中用于免训练视频推理分割的解耦注意力融合
计算机视觉与模式识别
2026-04-27 v2
摘要
多模态大语言模型(MLLMs)通过关注与文本查询相关的视觉标记,展示了强大的视频理解能力。为了以免训练的方式直接将其应用于定位,我们将视频推理分割视为视频问答任务,并通过展开机制提取注意力图。然而,原始注意力图是嘈杂的,并且与对象区域的对齐不佳。我们提出了解耦注意力融合(DecAF),它通过两种机制细化这些图:(1)对比对象-背景融合和(2)互补视频帧融合。该方法抑制了不相关的激活并增强了对象聚焦线索,使得能够将注意力图直接转换为粗略的分割掩码。此外,我们引入了注意力引导的SAM2提示以获得细粒度掩码。与现有方法将MLLMs与SAM联合训练不同,我们的方法完全无需重新训练即可运行。DecAF在指称和推理视频对象分割基准上均优于免训练方法,并达到了与基于训练的方法相当的性能。
引用
@article{arxiv.2510.19592,
title = {Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation},
author = {Su Ho Han and Jeongseok Hyun and Pilhyeon Lee and Minho Shim and Dongyoon Wee and Seon Joo Kim},
journal= {arXiv preprint arXiv:2510.19592},
year = {2026}
}
备注
Accepted to ICLR 2026. Code is available at https://github.com/HYUNJS/DecAF