中文

InfiMM-HD:高分辨率多模态理解的突破性进展

计算机视觉与模式识别 2024-03-05 v1

摘要

最近,多模态大语言模型(MLLM)取得了显著进展。然而,在准确识别和理解高分辨率图像中复杂细节方面仍面临挑战。尽管这一领域对 MLLM 的健全发展至关重要,但仍未得到充分调查。为此,我们提出了 InfiMM-HD,一种专为处理不同分辨率图像而设计的新型架构,能够在低计算开销下实现此目标。这一创新促进了 MLLM 向更高分辨率能力的扩展。InfiMM-HD 集成了跨注意力模块和视觉窗口,以降低计算成本。通过将这一架构设计与四阶段训练管道集成,我们的模型能够高效且具成本效益地实现改进的视觉感知。实证研究表明,InfiMM-HD 的鲁棒性和有效性突出,为相关领域的探索开辟了新 avenue。代码和模型可在 https://huggingface.co/Infi-MM/infimm-hd 找到。

关键词

引用

@article{arxiv.2403.01487,
  title  = {InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding},
  author = {Haogeng Liu and Quanzeng You and Xiaotian Han and Yiqi Wang and Bohan Zhai and Yongfei Liu and Yunzhe Tao and Huaibo Huang and Ran He and Hongxia Yang},
  journal= {arXiv preprint arXiv:2403.01487},
  year   = {2024}
}