PoSh:利用场景图引导 LLM 判官生成详细图像描述
计算机视觉与模式识别
2026-02-27 v3 人工智能
计算与语言
摘要
虽然视觉语言模型(VLM)已进步至生成详细图像描述,但评估仍是一个挑战。标准指标(如 CIDEr、SPICE)为短文本设计,针对如对象误识别等已不常见的错误进行调校。相比之下,长文本需要对属性和关系附加情况敏感,并能将错误局部化到特定文本片段。本文介绍 PoSh,一种用于详细图像描述的指标,利用场景图作为结构化评分标准指导 LLM 判官,生成基于细粒度错误(如组合理解错误)的综合得分。PoSh 可复制、可解释,且比现有指标(包括 GPT4o 判官)更能反映人类评分者的判断。为验证 PoSh,我们引入一个具有挑战性的新数据集 DOCENT。该新基准包含艺术品,配有专家编写的参考文本,以及模型生成的描述,增添了来自艺术史学生对质量的细粒度和粗粒度判断。因此,DOCENT 使我们能够评估详细图像描述指标及其本身在新颖领域中的表现。我们表明 PoSh 在 DOCENT 中的人类判断相关性比最佳开源替代方案高出 0.05 的斯皮尔曼 ρ 值,能够抵御图像类型(使用 CapArena,一个现有网络图像数据集)的影响,并且是强大的奖励函数,超越标准监督式微调。随着 PoSh 和 DOCENT 的推出,我们希望推动重要领域如辅助文本生成等方面的进展。
引用
@article{arxiv.2510.19060,
title = {PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions},
author = {Amith Ananthram and Elias Stengel-Eskin and Lorena A. Bradford and Julia Demarest and Adam Purvis and Keith Krut and Robert Stein and Rina Elster Pantalony and Mohit Bansal and Kathleen McKeown},
journal= {arXiv preprint arXiv:2510.19060},
year = {2026}
}
备注
Accepted at ICLR 2026. 26 pages, 9 figures. Metric/benchmark available at https://github.com/amith-ananthram/posh