DTTNet:通过深感知引导和记号化时序建模提高视频阴影检测
计算机视觉与模式识别
2025-11-11 v1
摘要
视频阴影检测面临两个相互交织的难题:区分阴影与复杂背景以及在不同照明条件下建模动态阴影变形。为解决阴影-背景歧义问题,我们利用通过提出的视觉-语言匹配模块(VMM)和深感知语义块(DSB)提取文本引导特征,以显式区分阴影与暗部物体。此外,我们引入自适应掩码重加权,在训练期间降低阴影半影区域的权重,并在最终解码器阶段应用边缘掩码以获得更好的监督。对于可变阴影形状的时序建模,我们提出了记号化时序块(TTB),该块解耦时空学习。TTB 将跨帧阴影语义概括为可学习的时序记号,实现了具有最小计算开销的高效序列编码。全面实验表明,在多个基准数据集上,方法在精度和实时推理效率方面实现了最先进的水平。代码已公开于 https://github.com/city-cheng/DTTNet。
引用
@article{arxiv.2511.06925,
title = {DTTNet: Improving Video Shadow Detection via Dark-Aware Guidance and Tokenized Temporal Modeling},
author = {Zhicheng Li and Kunyang Sun and Rui Yao and Hancheng Zhu and Fuyuan Hu and Jiaqi Zhao and Zhiwen Shao and Yong Zhou},
journal= {arXiv preprint arXiv:2511.06925},
year = {2025}
}