中文

面向变更描述的抗干扰表征学习:基于跨模态对比正则化

计算机视觉与模式识别 2024-07-17 v1

摘要

变更描述旨在简洁地描述一对相似图像之间的语义变化,同时能够抗拒干扰因素(如照明变化和视角变化)。在这些干扰因素下,未变化的物体常常看起来像是关于位置和尺度的伪变化,某些物体可能与其他物体重叠,从而导致特征之间的扰动和判别性能下降。然而,大多数现有方法直接捕获它们之间的差异,风险是在获取错误的差异特征。本文提出一种抗干扰表征学习网络,该网络在自监督方式下关联两个图像表征的 corresponding 通道,并去相关不同的通道,从而在干扰因素下获得一对稳定的图像表征。然后,该模型能够更好地相互作用以捕获可靠的差异特征用于生成描述。为基于最相关的差异特征生成单词,我们进一步设计了跨模态对比正则化,该正则化通过最大化注意差异特征与生成单词之间的对比对齐来正规化跨模态对齐。广泛的实验表明,我们的方法在四个公开数据集上超过了最新的方法。代码可在 https://github.com/tuyunbin/DIRL 获取。

关键词

引用

@article{arxiv.2407.11683,
  title  = {Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change Captioning},
  author = {Yunbin Tu and Liang Li and Li Su and Chenggang Yan and Qingming Huang},
  journal= {arXiv preprint arXiv:2407.11683},
  year   = {2024}
}

备注

Accepted by ECCV 2024