LLaVA-OneVision:简化视觉任务迁移
计算机视觉与模式识别
2024-10-29 v3 人工智能
计算与语言
摘要
我们提出了 LLaVA-OneVision,这是一系列由我们在 LLaVA-NeXT 博客系列中对数据、模型和视觉表示所见识所Consolidate而开发的开放式大型多模态模型(LMM)。我们的实验结果表明,LLaVA-OneVision 是首个能够同时在三大重要计算机视觉场景中推进开放式 LMM 性能边界的单一模型:单图像、多图像和视频场景。重要的是,LLaVA-OneVision 的设计允许在不同模态/场景之间进行强大的迁移学习,产生新的潜在能力。特别是,通过从图像迁移到视频,展示了强大的视频理解和跨场景能力。
引用
@article{arxiv.2408.03326,
title = {LLaVA-OneVision: Easy Visual Task Transfer},
author = {Bo Li and Yuanhan Zhang and Dong Guo and Renrui Zhang and Feng Li and Hao Zhang and Kaichen Zhang and Peiyuan Zhang and Yanwei Li and Ziwei Liu and Chunyuan Li},
journal= {arXiv preprint arXiv:2408.03326},
year = {2024}
}
备注
Project Homepage: https://llava-vl.github.io/blog/2024-08-05-llava-onevision/