中文

持续全景感知:面向遥感图像的多模态增量解释

计算机视觉与模式识别 2024-11-22 v2 多媒体

摘要

持续学习 (continual learning, CL) 打破单一任务的单向训练模式,使模型能够持续适应新数据、语义和任务。然而,当前的 CL 方法主要聚焦于单一任务。且由于缺乏旧数据,CL 模型常出现灾难性遗忘和语义漂移,后者在遥感解释中尤为突出,因为遥感图像的语义细粒度。本文提出持续全景感知 (Continual Panoptic Perception, CPP),一个统一的持续学习模型,利用覆盖像素级分类、实例级分割和图像级感知的多任务联合学习,实现对遥感图像的通用解释。具体而言,我们提出协作跨模态编码器 (collaborative cross-modal encoder, CCE),用于同步提取图像特征,支持像素分类和描述生成。为在无例外存储的情况下继承旧模型知识,我们提出任务交互式知识蒸馏 (task-interactive knowledge distillation, TKD) 方法,利用跨模态优化和任务非对称伪标签 (task-asymmetric pseudo-labeling, TPL) 以缓解灾难性遗忘。此外,我们还提出联合优化机制以实现端到端的多模态全景感知。在细粒度全景感知数据集上的实验结果验证了所提模型的有效性,同时证明联合优化可使子任务 CL 效率提升约 13%。

关键词

引用

@article{arxiv.2407.14242,
  title  = {Continual Panoptic Perception: Towards Multi-modal Incremental Interpretation of Remote Sensing Images},
  author = {Bo Yuan and Danpei Zhao and Zhuoran Liu and Wentao Li and Tian Li},
  journal= {arXiv preprint arXiv:2407.14242},
  year   = {2024}
}

备注

Accepted in ACMMM 2024