中文

面向域通用性的变更检测视觉问答文本条件状态空间模型

计算机视觉与模式识别 2025-10-27 v3

摘要

地球表面正在发生变化,检测这些变化为各方面的人类社会提供了宝贵见解。虽然传统的变更检测方法已被用于从双时序图像中检测变化,但这些方法通常需要专家知识才能准确解释。为使非专家用户能够更广泛且灵活地获取变更信息,变更检测视觉问答(CDVQA)任务应运而出。然而,现有的 CDVQA 方法是在训练和测试数据集分布相似的假设下developed的,这在现实应用中往往不成立,因而会发生域迁移。在本文中,围绕解决域迁移问题,重新审视了 CDVQA 任务。为此,本文引入了名为 BrightVQA 的新型多模态多域数据集,以促进 CDVQA 领域的域泛化研究。此外,提出了一种新型状态空间模型,称为文本条件状态空间模型(TCSSM)。TCSSM 框架旨在统一地利用双时序图像和灾情相关文本信息,以提取跨域的领域不变特征。框架中的输入依赖参数通过双时序图像和灾情相关描述动态预测,从而促进双时序视觉数据与关联文本描述之间的对齐。对所提方法与最新模型进行了大量实验评估,结果一致显示其性能优越。代码和数据集将在被接受后公开发布于 https://github.com/Elman295/TCSSM。

关键词

引用

@article{arxiv.2508.08974,
  title  = {Text-conditioned State Space Model For Domain-generalized Change Detection Visual Question Answering},
  author = {Elman Ghazaei and Erchan Aptoula},
  journal= {arXiv preprint arXiv:2508.08974},
  year   = {2025}
}