中文

面向多变化描述的上下文感知差异蒸馏

计算机视觉与模式识别 2024-06-10 v2

摘要

多变化描述旨在用自然语言描述图像对中复杂且耦合的变化。与单一变化描述相比,该任务要求模型具有更高层次的认知能力来推理任意数量的变化。在本文中,我们提出了一种新颖的上下文感知差异蒸馏(CARD)网络,以捕获所有真实变化并生成句子。给定一个图像对,CARD首先解耦出聚合所有相似/不相似语义的上下文特征,称为共同/差异上下文特征。然后,设计一致性和独立性约束来保证共同/差异上下文特征的对齐/差异。进一步,共同上下文特征引导模型挖掘局部不变特征,这些特征从图像对中减去以蒸馏出局部差异特征。接着,差异上下文特征增强局部差异特征,以确保所有变化都被蒸馏出来。通过这种方式,我们获得了所有变化的全表示,并由一个Transformer解码器将其翻译成语言句子。在三个公开数据集上的大量实验表明,CARD的性能优于最先进的方法。代码可在 https://github.com/tuyunbin/CARD 获取。

关键词

引用

@article{arxiv.2405.20810,
  title  = {Context-aware Difference Distilling for Multi-change Captioning},
  author = {Yunbin Tu and Liang Li and Li Su and Zheng-Jun Zha and Chenggang Yan and Qingming Huang},
  journal= {arXiv preprint arXiv:2405.20810},
  year   = {2024}
}

备注

Accepted by ACL 2024 main conference (long paper)