重新思考基于参照的独特图像描述生成
计算机视觉与模式识别
2022-07-25 v1
摘要
独特图像描述生成(DIC)——生成描述目标图像独特细节的独特描述——在过去几年中受到了相当多的关注。近期的一项 DIC 工作提出通过与一组语义相似的参照图像(即基于参照的 DIC,Ref-DIC)进行比较来生成独特描述,旨在使生成的描述能够区分目标图像与参照图像。遗憾的是,现有 Ref-DIC 工作所使用的参照图像易于区分:这些参照图像仅在场景层面与目标图像相似,且共有物体很少,以至于 Ref-DIC 模型即使不考虑参照图像也能轻易生成独特描述。为确保 Ref-DIC 模型真正感知目标图像中的独特物体(或属性),我们首先提出两个新的 Ref-DIC 基准。具体而言,我们设计了一种两阶段匹配机制,在物体/属性层面(而非场景层面)严格控制目标图像与参照图像之间的相似度。其次,为生成独特描述,我们开发了一个基于 Transformer 的强 Ref-DIC 基线模型,称为 TransDIC。它不仅从目标图像中提取视觉特征,还对目标图像与参照图像中物体之间的差异进行编码。最后,为进行更可信的基准评测,我们提出一种用于 Ref-DIC 的新评价指标 DisCIDEr,该指标同时评估生成描述的准确性与独特性。实验结果表明,我们的 TransDIC 能够生成独特描述,并且在两个新基准上的不同指标均优于多个 state-of-the-art 模型。
引用
@article{arxiv.2207.11118,
title = {Rethinking the Reference-based Distinctive Image Captioning},
author = {Yangjun Mao and Long Chen and Zhihong Jiang and Dong Zhang and Zhimeng Zhang and Jian Shao and Jun Xiao},
journal= {arXiv preprint arXiv:2207.11118},
year = {2022}
}
备注
ACM MM 2022