中文

DFR:面向多模态少样本分割的分解-融合-重构框架

计算机视觉与模式识别 2025-07-23 v1

摘要

本文提出 DFR(Decompose, Fuse and Reconstruct), 一个新颖的框架, 旨但解决在少样本分割(FSS)中有效利用多模态指导的根本挑战。 虽然现有方法主要依赖视觉支持样本或文本描述, 但其单模态或双模态范式限制了对真实场景中丰富感知信息的利用。 为克服这一限制, 该方法利用 Segment Anything Model(SAM)系统性地集成视觉、文本和音频三种模态, 以实现增强的语义理解。 DFR 框架引入了三个关键创新: 1) 多模态分解: 采用分层分解方案,通过 SAM 提取视觉区域提案, 将文本语义扩展为细粒度描述, 处理音频特征以实现情境丰富化; 2) 多模态对比融合: 采用对比学习融合策略, 在视觉、文本和音频模态之间保持一致性, 并实现前景与背景特征之间的动态语义交互; 3) 双路径重构: 一个自适应集成机制,将来自三模态融合 token 的语义指导与来自多模态位置先验的几何线索相结合。 在视觉、文本和音频模态下, 在 synthetic 和 real 设置下进行大量实验, 证明了 DFR 在 state-of-the-art 方法之上的显著性能提升。

关键词

引用

@article{arxiv.2507.16736,
  title  = {DFR: A Decompose-Fuse-Reconstruct Framework for Multi-Modal Few-Shot Segmentation},
  author = {Shuai Chen and Fanman Meng and Xiwei Zhang and Haoran Wei and Chenhao Wu and Qingbo Wu and Hongliang Li},
  journal= {arXiv preprint arXiv:2507.16736},
  year   = {2025}
}

备注

3 figures