文本与视觉引导的源自由跨域少样本分割任务适应
计算机视觉与模式识别
2025-08-08 v1
摘要
少样本分割 (FSS) 旨在高效分割新对象的实例,但当训练和部署之间存在域差异时,其性能会显著下降。跨域少样本分割 (CD-FSS) 旨在缓解这种性能下降。当前的 CD-FSS 方法主要致力于开发在源域上具备跨域泛化能力的分割模型。然而,随着数据隐私日益受到重视以及最小化数据传输和训练成本的 imperative 的提高,面向源自由 CD-FSS 方法的开发变得至关重要。本文提出一种源自由 CD-FSS 方法,利用文本和视觉信息促进目标域任务适应,而无需源域数据。具体而言,我们首先在预训练主干网络的特征金字塔上附加任务特定注意力适配器 (TSAA),以适应从共享预训练主干网络中提取的多层特征到目标任务。随后,通过视觉-视觉嵌入对齐 (VVEA) 模块和文本-视觉嵌入对齐 (TVEA) 模块训练 TSAA 的参数。VVEA 模块利用全局-局部视觉特征对齐不同视图之间的图像特征,而 TVEA 模块则利用来自预对齐多模态特征(例如来自 CLIP 的特征)的文本先验指导跨模态适应。通过密集比较操作和后续通过 skip 连接的融合,我们的方法产生细化的预测掩码。在 1-shot 和 5-shot 设置下,所提出的方法在四个跨域数据集上实现了平均分段准确率提升 2.18% 和 4.11%,显著优于最新的 CD-FSS 方法。代码可在 https://github.com/ljm198134/TVGTANet 查阅。
引用
@article{arxiv.2508.05213,
title = {Textual and Visual Guided Task Adaptation for Source-Free Cross-Domain Few-Shot Segmentation},
author = {Jianming Liu and Wenlong Qiu and Haitao Wei},
journal= {arXiv preprint arXiv:2508.05213},
year = {2025}
}
备注
10 pages,Accepted at ACMMM2025