基于分割与深度模型的组合式视觉语言理解
计算机视觉与模式识别
2024-06-28 v1 人工智能
机器学习
摘要
我们引入了一个开创性的统一库,利用深度模型和分割模型增强语言-视觉模型在零样例理解任务中的神经认知能力。该库融合了深度模型(DAM)、分割模型(SAM)与GPT-4V的能力,提升了视觉问答(VQA)和组合推理等多模态任务的性能。通过在符号实例层面融合分割与深度分析,该库为语言模型提供了更细致的输入,显著 advancement 了图像解释。经 diverse in-the-wild 真实图像验证,我们的实验结果展示了通过神经符号集成实现视觉语言模型进步的潜力。这种新颖方法以前所未有的方式融合了视觉与语言分析。总体而言,我们的库为未来通过先进多模态技术解码复杂现实世界开辟了新方向,代码已发布于\url{https://github.com/AnthonyHuo/SAM-DAM-for-Compositional-Reasoning}。
引用
@article{arxiv.2406.18591,
title = {Composition Vision-Language Understanding via Segment and Depth Anything Model},
author = {Mingxiao Huo and Pengliang Ji and Haotian Lin and Junchen Liu and Yixiao Wang and Yijun Chen},
journal= {arXiv preprint arXiv:2406.18591},
year = {2024}
}