中文

Change3D:从视频建模视角重访变化检测与描述

计算机视觉与模式识别 2025-03-25 v1

摘要

本文提出Change3D,一个通过视频建模来重新概念化变化检测和描述任务的框架。近期方法通过将每个时双图视为独立帧,采用共享权重的图像编码器提取空间特征,然后使用变化提取器捕获两图像间的差异。然而,图像特征编码是一种与任务无关的过程,无法有效关注变化区域。此外,针对不同变化检测和描述任务设计的不同变化提取器使得统一框架困难。为此,Change3D将时双图视为包含两个类似小视频帧的图像。通过在时双图之间集成可学习的感知帧,视频编码器使感知帧能够直接与图像交互并感知其差异。因此,我们可以摆脱复杂的变化提取器,提供适用于不同变化检测和描述任务的统一框架。在多个任务上验证Change3D,涵盖变化检测(包括二值变化检测、语义变化检测和建筑物损伤评估)和变化描述,跨越八个标准基准。毫无华丽修饰,此简单而有效的框架可实现卓越的性能,其参数仅为当前SOTA方法的约6%~13%,FLOPs仅为8%~34%。我们希望Change3D能作为2D模型的替代方案,并促进未来研究。

关键词

引用

@article{arxiv.2503.18803,
  title  = {Change3D: Revisiting Change Detection and Captioning from A Video Modeling Perspective},
  author = {Duowang Zhu and Xiaohu Huang and Haiyan Huang and Hao Zhou and Zhenfeng Shao},
  journal= {arXiv preprint arXiv:2503.18803},
  year   = {2025}
}

备注

conference paper, accepted by CVPR 2025