中文

LLaVA-OneVision:简化视觉任务迁移

计算机视觉与模式识别 2024-10-29 v3 人工智能 计算与语言

摘要

我们提出了 LLaVA-OneVision,这是一系列由我们在 LLaVA-NeXT 博客系列中对数据、模型和视觉表示所见识所Consolidate而开发的开放式大型多模态模型(LMM)。我们的实验结果表明,LLaVA-OneVision 是首个能够同时在三大重要计算机视觉场景中推进开放式 LMM 性能边界的单一模型:单图像、多图像和视频场景。重要的是,LLaVA-OneVision 的设计允许在不同模态/场景之间进行强大的迁移学习,产生新的潜在能力。特别是,通过从图像迁移到视频,展示了强大的视频理解和跨场景能力。

关键词

引用

@article{arxiv.2408.03326,
  title  = {LLaVA-OneVision: Easy Visual Task Transfer},
  author = {Bo Li and Yuanhan Zhang and Dong Guo and Renrui Zhang and Feng Li and Hao Zhang and Kaichen Zhang and Peiyuan Zhang and Yanwei Li and Ziwei Liu and Chunyuan Li},
  journal= {arXiv preprint arXiv:2408.03326},
  year   = {2024}
}

备注

Project Homepage: https://llava-vl.github.io/blog/2024-08-05-llava-onevision/