中文

OmChat:面向强长上下文与视频理解的多模态语言模型训练配方

计算机视觉与模式识别 2024-07-09 v1 计算与语言

摘要

我们介绍 OmChat,一种旨在在处理长上下文和视频理解任务方面表现卓越的模型。OmChat 的新型架构标准化了不同视觉输入的处理方式,使其更高效且更具可适应性。它采用动态视觉编码过程,有效处理各种分辨率的图像,捕捉不同图像质量下的细微细节。OmChat 利用主动渐进式多模态预训练策略,逐步增加模型处理长上下文的能力,并提升其整体性能。通过在训练中选择高质量数据,OmChat 能从最相关和最具信息性的数据点中学习。支持最长 512K 长度的上下文,OmChat 在涉及多图像和视频的任务中表现出色,超过了大多数开源模型。此外,OmChat 提出了一种用于统一单张图像文本、多图像文本和视频等复杂多模态输入的提示策略,实现了在单张图像基准测试中的竞争性能。为进一步评估模型能力,我们提出了一个名为 Temporal Visual Needle in a Haystack 的基准数据集。该数据集评估了 OmChat 在长视频中理解时间视觉细节的能力。我们的分析表明,OmChat 成功的关键因素包括:支持任意比例的高分辨率图像、主动渐进式预训练策略以及高质量的监督微调数据集。本报告提供了 OmChat 能力的详细概述以及增强其视觉理解性能的策略。

关键词

引用

@article{arxiv.2407.04923,
  title  = {OmChat: A Recipe to Train Multimodal Language Models with Strong Long Context and Video Understanding},
  author = {Tiancheng Zhao and Qianqian Zhang and Kyusong Lee and Peng Liu and Lu Zhang and Chunxin Fang and Jiajia Liao and Kelei Jiang and Yibo Ma and Ruochen Xu},
  journal= {arXiv preprint arXiv:2407.04923},
  year   = {2024}
}

备注

14 pages