从比较判断建模图像标题评分
计算机视觉与模式识别
2026-03-26 v2 机器学习
摘要
图像标题评分正变得越来越重要,因为计算机生成的标题被广泛用于描述性标注。然而,对标题描述图像准确性进行评分在耗时且主观。相比之下,人们往往更容易比较(在两对之间)哪个图像-标题对更能匹配。本研究提出了一种机器学习框架,通过建模比较判断而非直接评分。该模型随后可用于对未见的图像-标题对进行排序,方式类似于基于直接评分训练的回归模型。灵感来自最先进的回归方法,我们使用预训练的 ViLBERT 模型提取视觉和文本特征,并调整基线模型的学习参数以提高模型性能。该新的回归模型(以 Kendall's 为准绳)在 VICR 数据集上优于基线模型(以 Kendall's 为准绳)。相同的模型结构被应用于比较学习框架。在基于比较判断(图像-标题对 A 比图像-标题对 B 更能匹配)训练的比较学习模型 achieves 类似于回归模型的性能(以 Kendall's 为准绳)。此外,进行了一次小规模的人类主观研究,比较了直接评分、两两比较和同图比较的成本和质量。结果显示,比较判断比直接评分更快且人类标注者间的一致性更高。这些结果表明,将比较判断而非直接评分作为训练数据标签收集对于降低标注成本和提高一致性具有前景。训练此类比较判断的数据模型可表现得就像训练直接评分的数据模型一样好。
引用
@article{arxiv.2602.00381,
title = {Modeling Image-Caption Rating from Comparative Judgments},
author = {Kezia Minni and Qiang Zhang and Monoshiz Mahbub Khan and Zhe Yu},
journal= {arXiv preprint arXiv:2602.00381},
year = {2026}
}
备注
12 pages