GroundCap:一个视觉定位的图像描述数据集
计算机视觉与模式识别
2025-06-27 v3 计算与语言
摘要
当前的图像描述系统缺乏将描述性文本与特定视觉元素相关联的能力,使其输出难以验证。虽然近期的方法提供了一些定位能力,但它们无法在多个引用间跟踪对象身份,也无法同时对动作和对象进行定位。我们提出了一种新颖的基于 ID 的定位系统,能够实现一致的对象引用跟踪和动作-对象链接。我们提出了 GroundCap,一个包含来自 77 部电影的 52,016 张图像的数据集,附带 344 个人工标注和 52,016 个自动生成的描述。每个描述都使用一个标签系统定位到检测到的对象(132 类)和动作(51 类),该系统在将动作链接到相应对象的同时保持对象身份。我们的方法具有用于引用跟踪的持久对象 ID、显式的动作-对象链接,以及通过 K-means 聚类对背景元素进行分割的特点。我们提出了 gMETEOR,一个结合描述质量与定位准确率的指标,并通过在 GroundCap 上微调 Pixtral-12B 和 Qwen2.5-VL 7B 建立了基线性能。人工评估证明了我们的方法在生成具有连贯对象引用的可验证描述方面的有效性。
引用
@article{arxiv.2502.13898,
title = {GroundCap: A Visually Grounded Image Captioning Dataset},
author = {Daniel A. P. Oliveira and Lourenço Teodoro and David Martins de Matos},
journal= {arXiv preprint arXiv:2502.13898},
year = {2025}
}
备注
37 pages