SAM-DAQ:基于深度引导自适应查询的任意分割模型用于RGB-D视频显著目标检测
计算机视觉与模式识别
2025-11-14 v1
摘要
近年来,任意分割模型(SAM)引起了广泛关注,常被视为通用的分割视觉基础模型。一些研究者尝试将基础模型直接应用于RGB-D视频显著目标检测(RGB-D VSOD)任务,但这通常会遇到三个挑战,包括对人工提示的依赖、顺序适配器的高内存消耗以及记忆注意力的计算负担。为了解决这些局限性,我们提出了一种新方法,即基于深度引导自适应查询的任意分割模型(SAM-DAQ),该方法通过在一个统一框架内无缝集成深度和时序线索,使SAM2能够从视频中突显显著目标。首先,我们部署了一个基于并行适配器的多模态图像编码器(PAMIE),该编码器以跳跃连接的方式集成了多个深度引导并行适配器(DPA)。值得注意的是,我们在无提示条件下微调冻结的SAM编码器,其中DPA利用深度线索促进多模态特征的融合。其次,我们部署了一个查询驱动的时序记忆(QTM)模块,该模块将记忆库和提示嵌入统一到一个可学习的流水线中。具体来说,通过同时利用帧级查询和视频级查询,QTM模块不仅可以有选择地提取时序一致性特征,还可以迭代更新查询的时序表示。在三个RGB-D VSOD数据集上进行了大量实验,结果表明,所提出的SAM-DAQ在所有评估指标上均持续优于最先进的方法。
引用
@article{arxiv.2511.09870,
title = {SAM-DAQ: Segment Anything Model with Depth-guided Adaptive Queries for RGB-D Video Salient Object Detection},
author = {Jia Lin and Xiaofei Zhou and Jiyuan Liu and Runmin Cong and Guodao Zhang and Zhi Liu and Jiyong Zhang},
journal= {arXiv preprint arXiv:2511.09870},
year = {2025}
}
备注
Accepted to 40th AAAI Conference on Artificial Intelligence (AAAI 2026)