面向多变化描述的上下文感知差异蒸馏
计算机视觉与模式识别
2024-06-10 v2
摘要
多变化描述旨在用自然语言描述图像对中复杂且耦合的变化。与单一变化描述相比,该任务要求模型具有更高层次的认知能力来推理任意数量的变化。在本文中,我们提出了一种新颖的上下文感知差异蒸馏(CARD)网络,以捕获所有真实变化并生成句子。给定一个图像对,CARD首先解耦出聚合所有相似/不相似语义的上下文特征,称为共同/差异上下文特征。然后,设计一致性和独立性约束来保证共同/差异上下文特征的对齐/差异。进一步,共同上下文特征引导模型挖掘局部不变特征,这些特征从图像对中减去以蒸馏出局部差异特征。接着,差异上下文特征增强局部差异特征,以确保所有变化都被蒸馏出来。通过这种方式,我们获得了所有变化的全表示,并由一个Transformer解码器将其翻译成语言句子。在三个公开数据集上的大量实验表明,CARD的性能优于最先进的方法。代码可在 https://github.com/tuyunbin/CARD 获取。
引用
@article{arxiv.2405.20810,
title = {Context-aware Difference Distilling for Multi-change Captioning},
author = {Yunbin Tu and Liang Li and Li Su and Zheng-Jun Zha and Chenggang Yan and Qingming Huang},
journal= {arXiv preprint arXiv:2405.20810},
year = {2024}
}
备注
Accepted by ACL 2024 main conference (long paper)