GREC:广义指代表达理解
计算机视觉与模式识别
2023-12-27 v2
摘要
经典指代表达理解(REC)的目标是生成与给定文本描述中所提及物体相对应的边界框。通常,经典 REC 中的现有数据集与技术专为涉及单一目标的表达而设计,即一个单独的表达关联于一个特定物体。涉及多个目标或不涉及特定目标的表达尚未被考虑。这一限制阻碍了 REC 的实际适用性。本研究引入了一个称为广义指代表达理解(GREC)的新基准。该基准通过允许表达描述任意数量的目标物体,扩展了经典 REC。为实现此目标,我们构建了首个大规模 GREC 数据集,名为 gRefCOCO。该数据集涵盖一系列表达:涉及多个目标的表达、无特定目标的表达,以及单目标表达。GREC 与 gRefCOCO 的设计确保了与经典 REC 的平滑兼容。所提出的 gRefCOCO 数据集、GREC 方法实现代码以及 GREC 评估代码可在 https://github.com/henghuiding/gRefCOCO 获取。
引用
@article{arxiv.2308.16182,
title = {GREC: Generalized Referring Expression Comprehension},
author = {Shuting He and Henghui Ding and Chang Liu and Xudong Jiang},
journal= {arXiv preprint arXiv:2308.16182},
year = {2023}
}
备注
GREC Technical Report, Project Page: https://henghuiding.github.io/GRES