中文

ImageInWords:解锁超详细图像描述

计算机视觉与模式识别 2024-10-30 v2 计算与语言

摘要

尽管有“一图胜千言”的古老谚语,生成准确的超详细图像描述仍然是一个未解决的问题。基于网络抓取的简短图像文本训练的视觉语言模型常常生成不完整且存在视觉不一致的描述。我们通过一种新颖的数据中心方法ImageInWords(IIW)来解决这一问题,这是一个精心设计的人机交互框架,用于策展超详细的图像描述。在IIW数据上的人工评估显示,与最近的数据集(+66%)和GPT4V(+48%)相比,在全面性、特异性、幻觉等方面取得了显著提升。我们还表明,使用IIW数据进行微调,即使只有9k样本,也能使这些指标比使用先前工作训练的模型提升+31%。最后,我们在文本到图像生成和视觉语言推理任务上评估了IIW模型。我们生成的描述产生了最高保真度的图像,并在ARO、SVO-Probes和Winoground数据集上将组合推理提升了高达6%。我们发布了IIW Eval基准,包含人工判断标签、来自我们框架的对象和图像级注释,以及通过IIW模型增强的现有图像描述数据集。

关键词

引用

@article{arxiv.2405.02793,
  title  = {ImageInWords: Unlocking Hyper-Detailed Image Descriptions},
  author = {Roopal Garg and Andrea Burns and Burcu Karagol Ayan and Yonatan Bitton and Ceslee Montgomery and Yasumasa Onoe and Andrew Bunner and Ranjay Krishna and Jason Baldridge and Radu Soricut},
  journal= {arXiv preprint arXiv:2405.02793},
  year   = {2024}
}

备注

Webpage (https://google.github.io/imageinwords), GitHub (https://github.com/google/imageinwords), HuggingFace (https://huggingface.co/datasets/google/imageinwords)