通过蒸馏图文匹配模型实现更 grounded 的图像描述生成
计算机视觉与模式识别
2020-04-02 v1 计算与语言
摘要
视觉注意力不仅提升了图像描述生成器的性能,还作为一种视觉解释,定性地衡量描述合理性与模型透明度。具体而言,我们期望描述生成器在生成对应词语时能将其注意凝视固定在正确对象上。该能力亦称为 grounded 图像描述生成。然而,现有描述生成器的定位准确率远不能令人满意。为在保持描述质量的同时提升定位准确率,将词-区域对齐作为强监督进行收集成本高昂。为此,我们提出一种词性(POS)增强的图文匹配模型(SCAN \cite{lee2018stacked}):POS-SCAN,作为用于更 grounded 图像描述生成的有效知识蒸馏。其益处有两方面:1)给定句子与图像,POS-SCAN 比 SCAN 能更准确地定位对象;2)POS-SCAN 作为描述生成器视觉注意力模块的词-区域对齐正则化。通过展示基准实验结果,我们证明配备 POS-SCAN 的传统图像描述生成器可在无强监督下显著提升定位准确率。最后同样重要的是,我们探索了在 grounded 图像描述生成背景下不可或缺的自临界序列训练(SCST)\cite{Rennie_2017_CVPR},并表明图文匹配分数可作为更 grounded 描述的奖励\footnote{https://github.com/YuanEZhou/Grounded-Image-Captioning}。
引用
@article{arxiv.2004.00390,
title = {More Grounded Image Captioning by Distilling Image-Text Matching Model},
author = {Yuanen Zhou and Meng Wang and Daqing Liu and Zhenzhen Hu and Hanwang Zhang},
journal= {arXiv preprint arXiv:2004.00390},
year = {2020}
}
备注
Accepted by CVPR 2020