InfiMM-HD:高分辨率多模态理解的突破性进展
计算机视觉与模式识别
2024-03-05 v1
摘要
最近,多模态大语言模型(MLLM)取得了显著进展。然而,在准确识别和理解高分辨率图像中复杂细节方面仍面临挑战。尽管这一领域对 MLLM 的健全发展至关重要,但仍未得到充分调查。为此,我们提出了 InfiMM-HD,一种专为处理不同分辨率图像而设计的新型架构,能够在低计算开销下实现此目标。这一创新促进了 MLLM 向更高分辨率能力的扩展。InfiMM-HD 集成了跨注意力模块和视觉窗口,以降低计算成本。通过将这一架构设计与四阶段训练管道集成,我们的模型能够高效且具成本效益地实现改进的视觉感知。实证研究表明,InfiMM-HD 的鲁棒性和有效性突出,为相关领域的探索开辟了新 avenue。代码和模型可在 https://huggingface.co/Infi-MM/infimm-hd 找到。
引用
@article{arxiv.2403.01487,
title = {InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding},
author = {Haogeng Liu and Quanzeng You and Xiaotian Han and Yiqi Wang and Bohan Zhai and Yongfei Liu and Yunzhe Tao and Huaibo Huang and Ran He and Hongxia Yang},
journal= {arXiv preprint arXiv:2403.01487},
year = {2024}
}