中文

Instruct2See: 学习跨分布去除任意遮挡

计算机视觉与模式识别 2025-05-26 v1

摘要

图像常因拍摄限制而被各种障碍物遮挡,妨碍对感兴趣物体的观察。大多数现有方法针对围栏或雨滴等特定元素的遮挡,但受限于真实世界遮挡的广泛范围,使得全面数据收集不切实际。为克服这些挑战,我们提出了Instruct2See,一个能够处理已见和未见障碍物的新型零样本框架。本方法的核心思想是通过将遮挡去除统一视为软-硬掩码恢复问题来消除遮挡,其中任何遮挡均可使用多模态提示(如视觉语义和文本指令)表示,并通过交叉注意力单元进行处理以增强上下文理解和改善模式控制。此外,可调掩码适配器允许动态软掩码,实现对不准确掩码的实时调整。在分布内和分布外障碍物上的广泛实验表明,Instruct2See在遮挡去除方面始终表现出强大的性能和泛化能力,无论障碍物是否出现在训练阶段。代码和数据集可在https://jhscut.github.io/Instruct2See获取。

关键词

引用

@article{arxiv.2505.17649,
  title  = {Instruct2See: Learning to Remove Any Obstructions Across Distributions},
  author = {Junhang Li and Yu Guo and Chuhua Xian and Shengfeng He},
  journal= {arXiv preprint arXiv:2505.17649},
  year   = {2025}
}