Ferret:任意粒度下随处指代与定位任何事物
计算机视觉与模式识别
2023-10-12 v1 计算与语言
摘要
我们介绍 Ferret,一种新型多模态大语言模型(MLLM),能够理解图像中任意形状或粒度的空间指代,并准确接地开放词汇描述。为在 LLM 范式中统一指代与接地,Ferret 采用一种新颖而强大的混合区域表示,联合离散坐标与连续特征来表示图像中的区域。为提取多样区域的连续特征,我们提出空间感知视觉采样器,善于处理不同形状间变化的稀疏性。因此,Ferret 可接受多样区域输入,如点、边界框和自由形状。为增强 Ferret 所需能力,我们策划了 GRIT,一个包含 110 万样本的综合指代与接地指令微调数据集,含有丰富层次空间知识,其中 9.5 万硬负样本以提升模型鲁棒性。所得模型不仅在经典指代与接地任务中取得优越性能,还大幅超越现有 MLLM 在基于区域和需定位的多模态对话中的表现。我们的评估也揭示了描述图像细节能力的显著提升,以及物体幻觉的明显缓解。代码与数据将发布于 https://github.com/apple/ml-ferret
引用
@article{arxiv.2310.07704,
title = {Ferret: Refer and Ground Anything Anywhere at Any Granularity},
author = {Haoxuan You and Haotian Zhang and Zhe Gan and Xianzhi Du and Bowen Zhang and Zirui Wang and Liangliang Cao and Shih-Fu Chang and Yinfei Yang},
journal= {arXiv preprint arXiv:2310.07704},
year = {2023}
}
备注
30 pages, 10 figures. Code/Project Website: https://github.com/apple/ml-ferret