中文

图像文本化:一种用于创建准确且详尽图像描述的自动化框架

计算机视觉与模式识别 2024-06-12 v1 计算与语言

摘要

图像描述数据集在推动图像理解、文本到图像生成和文本图像检索等各种应用的发展方面发挥着至关重要的作用。目前,图像描述数据集主要来源于两个方面:一是从网络上抓取的图像文本对,尽管数据丰富,但这些描述往往质量较低且充斥杂音;另一种是通过人工标注获得,诸如 COCO 等数据集通常篇幅较短,缺乏细节。虽然人类可以标注详尽的图像描述,但高昂的标注成本限制了其可行性。这凸显了需要更高效、更可扩展的方法来生成准确且详尽的图像描述的需求。本文提出一种创新框架,称为图像文本化(Image Textualization, IT),通过在多模态大语言模型(MLLMs)和多个视觉专家模型的协同作用下,自动生成高质量的图像描述,最大程度地将视觉信息转化为文本。为解决当前缺乏详尽描述基准测试的问题,本文提出了几个用于全面评估的基准测试,验证了我们框架创建的图像描述质量。此外,我们展示,LLaVA-7B 在接受我们框架精选的描述训练后,获得了更强的生成更丰富图像描述能力的性能,显著增加了输出的长度和细节,并降低了幻觉现象。

关键词

引用

@article{arxiv.2406.07502,
  title  = {Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions},
  author = {Renjie Pi and Jianshu Zhang and Jipeng Zhang and Rui Pan and Zhekai Chen and Tong Zhang},
  journal= {arXiv preprint arXiv:2406.07502},
  year   = {2024}
}