引导图像描述模型生成更具体的描述
计算机视觉与模式识别
2023-08-01 v1 机器学习
摘要
图像描述通常被定义为为图像生成与参考图文对分布相匹配的描述的任务。然而,标准描述数据集中的参考描述较短,且可能无法唯一标识其所描述的图片。当模型直接在从互联网收集的图像-替代文本对上训练时,这些问题进一步加剧。本文中,我们展示仅需对训练过程做极小改动即可生成更具体的描述。我们通过微调自回归描述模型以估计描述的条件分布与无条件分布,实现了无分类器引导(classifier-free guidance)。解码时应用的引导尺度控制了最大化 与 之间的权衡。与标准贪婪解码相比,引导尺度为 2 的解码显著提升了无参考指标如 CLIPScore(0.808 对比 0.775)及 CLIP 嵌入空间中描述→图像检索性能(recall@1 44.6% 对比 26.5%),但使标准基于参考的描述指标变差(例如 CIDEr 78.6 对比 126.1)。我们进一步探索使用语言模型引导解码过程,在无分类器引导所产生的无参考与基于参考描述指标 Pareto 前沿上获得微小提升,并大幅改进仅经最少筛选的网络数据训练的模型所生成描述的质量。
引用
@article{arxiv.2307.16686,
title = {Guiding Image Captioning Models Toward More Specific Captions},
author = {Simon Kornblith and Lala Li and Zirui Wang and Thao Nguyen},
journal= {arXiv preprint arXiv:2307.16686},
year = {2023}
}
备注
ICCV 2023