中文

OmniFusion技术报告

计算机视觉与模式识别 2024-04-10 v1 人工智能 机器学习

摘要

去年,多模态架构引发了基于AI的方法和解决方案的革命,扩展了大型语言模型(LLM)的能力。我们提出了一种基于预训练LLM和视觉模态适配器的OmniFusion模型。我们评估并比较了几种架构设计原则,以实现更好的文本和视觉数据耦合:MLP和Transformer适配器、各种CLIP ViT编码器(SigLIP、InternVIT等)及其融合方法、图像编码方法(整图或分块编码)以及两个7B LLM(专有和开源Mistral)。在8个视觉-语言基准上的实验显示,与开源的类似LLaVA的解决方案相比,最佳OmniFusion设置在不同VQA任务(VizWiz、Pope、MM-Vet、ScienceQA、MMBench、TextVQA、VQAv2、MMMU)上取得了最高分。我们还提出了OmniFusion在不同领域(家政、观光、文化、医学、手写和扫描方程识别等)提供高度详细答案的各种场景。基于Mistral的OmniFusion模型是开源解决方案,权重、训练和推理脚本可在https://github.com/AIRI-Institute/OmniFusion获取。

关键词

引用

@article{arxiv.2404.06212,
  title  = {OmniFusion Technical Report},
  author = {Elizaveta Goncharova and Anton Razzhigaev and Matvey Mikhalchuk and Maxim Kurkin and Irina Abdullaeva and Matvey Skripkin and Ivan Oseledets and Denis Dimitrov and Andrey Kuznetsov},
  journal= {arXiv preprint arXiv:2404.06212},
  year   = {2024}
}

备注

17 pages, 4 figures, 9 tables, 2 appendices