LLaVA-VSD:用于视觉空间描述的大语言与视觉助手
计算机视觉与模式识别
2024-10-31 v4 人工智能
摘要
视觉空间描述 (VSD) 旨在生成描述图像中对象之间空间关系的文本。传统的视觉空间关系分类 (VSRC) 方法通常仅输出图像中两个对象之间的空间关系,忽略了世界知识且缺乏通用语言能力。本文提出了用于视觉空间描述的大语言与视觉助手,即 LLaVA-VSD,旨在实现视觉空间关系的分类、描述与开放式描述。具体而言,模型首先利用给定的图表-标题对为三项任务构建 VSD 指令遵循数据集。随后,利用 LoRA 对拥有 130 亿参数且支持高分辨率图像的大语言视觉助手进行 VSD 微调。最后,使用大语言模型 (Qwen-2) 对生成的句子进行精炼,以提升其多样性和准确性。LLaVA-VSD 在多模态对话能力方面表现出色,能够遵循开放式指令协助关于图像中对象关系的询问。
引用
@article{arxiv.2408.04957,
title = {LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description},
author = {Yizhang Jin and Jian Li and Jiangning Zhang and Jianlong Hu and Zhenye Gan and Xin Tan and Yong Liu and Yabiao Wang and Chengjie Wang and Lizhuang Ma},
journal= {arXiv preprint arXiv:2408.04957},
year = {2024}
}
备注
We have discovered a significant error in the paper that affects the main conclusions. To ensure the accuracy of our research, we have decided to withdraw this paper and will resubmit it after making the necessary corrections