无参考图像描述度量中的眼镜蛇效应
计算与语言
2024-02-20 v1
摘要
评估文本描述与对应图像之间的兼容性是多模态研究的核心课题。近年来,利用视觉语言预训练模型 (VLM) 的无参考方法大量涌现。经验证据表明,这些创新方法与人类判断表现出更高的相关性,标志着该领域的重大进展。然而,仅与人类评估的较高相关性是否足以表明度量已完备?针对这一问题,本文研究无参考度量是否存在缺陷。具体而言,受眼镜蛇效应启发,我们将度量分数作为奖励,引导描述模型生成与度量标准紧密对齐的描述。如果某个度量存在缺陷,模型就会利用该缺陷并反映在生成的句子中。我们的发现表明,由这些度量引导的描述包含显著缺陷,例如不连贯的陈述和过度重复。随后,我们提出了一种名为 Self-Improving 的新方法,以纠正这些度量中已识别的缺陷。我们采用 GPT-4V 作为评估工具来评估生成的句子,结果显示我们的方法实现了 SOTA 性能。此外,我们还引入了一个名为 Flaws Caption 的具有挑战性的评估基准,用于全面评估无参考图像描述度量。我们的代码可在 https://github.com/aaronma2020/robust_captioning_metric 获取
引用
@article{arxiv.2402.11572,
title = {Cobra Effect in Reference-Free Image Captioning Metrics},
author = {Zheng Ma and Changxin Wang and Yawen Ouyang and Fei Zhao and Jianbing Zhang and Shujian Huang and Jiajun Chen},
journal= {arXiv preprint arXiv:2402.11572},
year = {2024}
}
备注
pre-print version