不遗漏任何细节:重新审视细粒度图像描述的自检索
摘要
图像描述系统无法生成细粒度的描述,因为它们训练的数据要么是有噪声的(替代文本),要么是通用的(人工标注)。最大似然训练进一步加剧了这一问题,因为它鼓励生成频繁出现的短语。先前的工作试图通过使用自检索(SR)奖励微调描述器来解决这一限制。然而,我们发现 SR 微调往往会降低描述的忠实度,甚至产生幻觉。在这项工作中,我们通过改进描述系统的 MLE 初始化并为 SR 微调过程设计一个课程来规避这一瓶颈。为此,我们提出了 (1) Visual Caption Boosting,这是一个新颖的框架,旨在向通用图像描述数据集中注入细粒度特性,同时保持以人工标注为基础;以及 (2) BagCurri,这是一个精心设计的训练课程,能更优化地利用自检索奖励的对比性质。两者结合,使描述器能够描述图像中的细粒度方面,同时保持对真实描述的忠实度。我们的方法在 SR 上比之前的工作高出 +8.9%(针对 99 个随机干扰项 (RD100) (Dessi et al., 2023));在 ImageCoDe 上高出 +7.6%。此外,现有的评估图像描述系统的指标无法奖励多样性,也无法评估模型的细粒度理解能力。我们的第三个贡献通过从评估的视角提出自检索来解决这一问题。我们引入了 TrueMatch,这是一个由高度相似的图像包组成的基准,它使用 SR 来评估描述器捕捉细微视觉差异的能力。我们在 TrueMatch 上评估并比较了几个最先进的开源 MLLM,发现我们的 SR 方法以显著优势优于它们所有(例如,比 Cambrian 高 +4.8% - 7.1%),同时参数量少了 1-2 个数量级。
引用
@article{arxiv.2409.03025,
title = {No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning},
author = {Manu Gaur and Darshan Singh and Makarand Tapaswi},
journal= {arXiv preprint arXiv:2409.03025},
year = {2025}
}
备注
Published at Transactions on Machine Learning Research (TMLR) https://openreview.net/forum?id=gqh0yzPYdo