中文

语言驱动的交互式阴影检测

计算机视觉与模式识别 2024-08-19 v1

摘要

传统阴影检测器通常识别静态图像或视频序列中的所有阴影区域。本工作提出了指代视频阴影检测(RVSD),这是一种创新任务,通过基于描述性自然语言提示对视频中的特定阴影进行分割,焕发了经典范式的活力。这种新颖的RVSD不仅能够基于描述实现对任意感兴趣阴影区域的分割(灵活性),还允许用户通过自然语言提示更直接、更自然地与视觉内容进行交互(交互性),为从高级视频编辑到虚拟现实体验的丰富应用铺平了道路。为了开创RVSD研究,我们策划了一个标注良好的RVSD数据集,涵盖86个视频和丰富的15,011对带对应阴影的文本描述。据我们所知,这是第一个解决RVSD的数据集。基于该数据集,我们提出了指代阴影跟踪记忆网络(RSM-Net)来解决RVSD任务。在我们的RSM-Net中,我们设计了双轨协同记忆(TSM)来存储帧内记忆特征和层次化帧间记忆特征,然后将这些记忆特征传递给记忆读取模块以细化当前视频帧的特征用于指代阴影检测。我们还开发了混合先验阴影注意力(MSA),利用物理先验通过将其与输入视频帧加权来获得粗略的阴影图,以学习更多的视觉特征。实验结果表明,我们的RSM-Net在RVSD上达到了最先进的性能,Overall IOU显著提升了4.4%。我们的代码和数据集可在https://github.com/whq-xxh/RVSD获取。

关键词

引用

@article{arxiv.2408.08543,
  title  = {Language-Driven Interactive Shadow Detection},
  author = {Hongqiu Wang and Wei Wang and Haipeng Zhou and Huihui Xu and Shaozhi Wu and Lei Zhu},
  journal= {arXiv preprint arXiv:2408.08543},
  year   = {2024}
}

备注

ACM MM 2024