利用对比奖励改进基于参考的区别性图像描述生成
计算机视觉与模式识别
2023-06-27 v1
摘要
区别性图像描述生成 (DIC)——生成描述目标图像独特细节的区别性描述——在过去几年中受到了相当多的关注。一种近期的 DIC 方法提出通过将目标图像与一组语义相似的参考图像进行比较来生成区别性描述,即基于参考的 DIC (Ref-DIC)。其旨在迫使生成的描述能够区分目标图像与参考图像。为确保 Ref-DIC 模型真正感知目标图像中的独特物体(或属性),我们提出了两个新的 Ref-DIC 基准,并开发了一个基于 Transformer 的 Ref-DIC 基线 TransDIC。该模型仅从目标图像中提取视觉特征,同时还编码目标图像与参考图像中物体之间的差异。我们进一步提出了更强的 TransDIC++,其包含一个额外的对比学习模块以充分利用参考图像。该新模块与模型无关,可轻松集成到各种 Ref-DIC 架构中。最后,为了更可信的基准测试,我们提出了一种用于 Ref-DIC 的名为 DisCIDEr 的新评估指标,用于评估生成描述的正确性与区别性。实验结果表明,我们的 TransDIC++ 能够生成区别性描述。此外,在两个新基准的不同指标上,它优于多个最先进 (SOTA) 模型。
引用
@article{arxiv.2306.14259,
title = {Improving Reference-based Distinctive Image Captioning with Contrastive Rewards},
author = {Yangjun Mao and Jun Xiao and Dong Zhang and Meng Cao and Jian Shao and Yueting Zhuang and Long Chen},
journal= {arXiv preprint arXiv:2306.14259},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2207.11118