Harlequin:基于颜色的合成数据生成用于指代表达理解
计算机视觉与模式识别
2024-11-25 v1 计算与语言
机器学习
摘要
指代表达理解(REC)旨在通过自然语言表达来识别场景中的特定对象,是视觉语言理解中的一个重要课题。目前最先进的方法通常基于深度学习,这通常需要昂贵的人工标注。一些工作通过有限监督学习或依赖大型视觉语言模型来解决这个问题。然而,用于合成标记数据的技术发展却被忽视了。在本文中,我们提出了一种新的框架,该框架考虑文本和视觉两种模态,为REC任务生成人工数据。我们的流程首先处理现有数据以生成注释的变体,然后使用修改后的注释作为指导生成图像。该流程的结果是一个名为Harlequin的新数据集,包含超过100万个查询。这种方法消除了手动数据收集和标注,实现了可扩展性并促进了任意复杂度的生成。我们在Harlequin上预训练了三个REC模型,然后在人工标注的数据集上进行微调和评估。我们的实验表明,在人工标注数据上进行预训练是有益的。
关键词
引用
@article{arxiv.2411.14807,
title = {Harlequin: Color-driven Generation of Synthetic Data for Referring Expression Comprehension},
author = {Luca Parolari and Elena Izzo and Lamberto Ballan},
journal= {arXiv preprint arXiv:2411.14807},
year = {2024}
}
备注
Accepted to ICPR 2024