DenseFusion-1M:融合视觉专家实现综合多模态感知
计算机视觉与模式识别
2024-11-26 v2 人工智能
摘要
现有的多模态大语言模型 (MLLM) 越来越强调对各种视觉元素的复杂理解,包括多个物体、文本信息以及空间关系。其开发的关键在于高质量的图像-文本数据集,这些数据集提供多样化的视觉元素和完整的图像描述。然而,现存的超细粒度数据集稀缺,阻碍了 MLLM 社区的进步。瓶颈在于当前描述引擎的感知能力有限,难以提供完整且准确的标注。为推动 MLLM 在综合视觉感知方面的前沿研究,我们提出感知融合方法,采用低成本但高效的描述引擎,实现对视觉元素的完整和准确描述。具体而言,感知融合将多样化感知专家作为图像先验条件,提供关于视觉元素的显式信息,并采用高效的 MLLM 作为核心枢纽,模拟先进 MLLM 的感知能力。我们精选 100 万张从未经 curated 的 LAION 数据集中挑选出的高度代表性图像,并生成密集描述,命名为 DenseFusion-1M。广泛实验表明,我们的引擎在各类视觉语言基准测试中均优于其他方法,尤其在高分辨率图像输入时表现更为突出。数据集和代码已公开于 https://github.com/baaivision/DenseFusion。
引用
@article{arxiv.2407.08303,
title = {DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception},
author = {Xiaotong Li and Fan Zhang and Haiwen Diao and Yueze Wang and Xinlong Wang and Ling-Yu Duan},
journal= {arXiv preprint arXiv:2407.08303},
year = {2024}
}
备注
Accepted by NeurIPS 2024. Project is available at https://github.com/baaivision/DenseFusion