中文

FlexCap:以可控细节描述图像中的任何内容

计算机视觉与模式识别 2025-01-30 v2 人工智能 计算与语言 机器学习

摘要

我们介绍了 FlexCap,这是一种能够生成不同长度的特定区域描述的视觉语言模型。FlexCap 被训练为输入边界框生成长度条件化的描述,从而能够控制信息密度,其描述范围从简洁的物体标签到详细的描述不等。为实现这一目标,我们利用带描述的网络图像创建了不同长度的大规模图像区域描述训练数据集。我们展示了 FlexCap 在多个应用中的有效性:首先,它在 Visual Genome 数据集上的密集描述任务中取得了优异的性能。其次,我们展示了如何将 FlexCap 的局部描述作为大型语言模型的输入以创建视觉问答(VQA)系统,在多个 VQA 基准测试中实现了最先进的零样本性能。我们的实验说明了 FlexCap 在图像标注、物体属性识别和视觉对话等任务中的实用性。项目网页:https://flex-cap.github.io 。

关键词

引用

@article{arxiv.2403.12026,
  title  = {FlexCap: Describe Anything in Images in Controllable Detail},
  author = {Debidatta Dwibedi and Vidhi Jain and Jonathan Tompson and Andrew Zisserman and Yusuf Aytar},
  journal= {arXiv preprint arXiv:2403.12026},
  year   = {2025}
}

备注

Accepted at NeurIPS 2024