中文

从视觉-语言视角重新审视阴影检测

计算机视觉与模式识别 2026-05-13 v1

摘要

阴影检测通常被形式化为以视觉为主导的密集预测问题,模型主要依赖像素级视觉监督来区分阴影区域与非阴影区域。然而,这种形式化在视觉模糊情况下可能不可靠,相似的暗色区域可能对应投射阴影或固有暗色表面,仅凭视觉证据不足以建立稳定决策规则。在本工作中,我们从视觉-语言视角重新审视阴影检测,认为在视觉线索之外显式的语义参考有助于实现稳健预测。我们提出 SVL,即 Shadow Vision-Language 框架,该框架将语言用作显式语义参考,以消除与视觉上相似暗色区域之间的歧义。SVL 通过场景级阴影比例回归目标将全局图像表示与与阴影相关的文本嵌入对齐,从而提供关于整体阴影范围的图像级指导。为将全局指导传递到密集推断,SVL 引入了全局到局部的耦合机制,以确保图像级指导与块级预测之间的一致性。并行地,SVL 对局部块级约束应用文本嵌入,以改善在挑战性外观条件下的细粒度判别。基于冻结的 DINOv3 图像编码器构建,该框架仅学习轻量级的投影和解码模块,实现参数高效设计,训练参数不足 11%。在多个阴影检测基准上的广泛实验,包括专门的硬案评估,表明该方法在整体性能和视觉模糊条件下的鲁棒性均表现优异。

关键词

引用

@article{arxiv.2605.11771,
  title  = {Revisiting Shadow Detection from a Vision-Language Perspective},
  author = {Yonghui Wang and Wengang Zhou and Hao Feng and Houqiang Li},
  journal= {arXiv preprint arXiv:2605.11771},
  year   = {2026}
}