OtterHD:一种高分辨率多模态模型
计算机视觉与模式识别
2023-11-08 v1 人工智能
摘要
本文提出 OtterHD-8B,一种由 Fuyu-8B 演进而来的创新多模态模型,专门设计用于以精细精度解读高分辨率视觉输入。与受限于固定尺寸视觉编码器的传统模型不同,OtterHD-8B 具备处理灵活输入尺寸的能力,确保了其在各类推理需求下的通用性。伴随该模型,我们引入了 MagnifierBench,一个用于审视模型辨别微小细节及小物体空间关系能力的评测框架。我们的对比分析表明,尽管当前领先模型在该基准上表现不佳,OtterHD-8B(尤其在直接处理高分辨率输入时)大幅优于同类模型。研究结果阐明了不同模型在视觉信息处理上的结构差异,以及视觉编码器预训练分辨率差异对此类基准上模型效果的影响。我们的研究凸显了灵活性与高分辨率输入能力在大型多模态模型中的关键作用,并例证了 Fuyu 架构简洁性在处理复杂视觉数据方面所蕴含的潜力。
引用
@article{arxiv.2311.04219,
title = {OtterHD: A High-Resolution Multi-modality Model},
author = {Bo Li and Peiyuan Zhang and Jingkang Yang and Yuanhan Zhang and Fanyi Pu and Ziwei Liu},
journal= {arXiv preprint arXiv:2311.04219},
year = {2023}
}
备注
Early Technical Report