惊讶值揭示图像描述中的多样性差距,不同评分器会改变故事
计算与语言
2025-11-10 v1
摘要
我们量化了图像描述中的语言多样性,使用惊讶值方差——即在描述集合中,标记级别负对数概率的离散程度。在MSCOCO测试集上,我们比较了五种最先进的视觉语言大语言模型,使用贪婪和核采样解码,以人类描述为基准。使用基于描述训练的n-gram语言模型衡量,人类描述的惊讶值方差约为模型的两倍,但用通用语言模型对同一组描述进行重新打分后,模式则完全相反。我们的分析引入了用于图像描述的惊讶值基准多样性指标。我们展示了依赖单一评分器会完全反转结论,因此,稳健的多样性评估必须在多个评分器下报告惊讶值。
引用
@article{arxiv.2511.04754,
title = {Surprisal reveals diversity gaps in image captioning and different scorers change the story},
author = {Nikolai Ilinykh and Simon Dobnik},
journal= {arXiv preprint arXiv:2511.04754},
year = {2025}
}
备注
Accepted and presented at INLG 2025