LLaVA-Octopus:解锁指令驱动的自适应投影器融合用于视频理解
计算机视觉与模式识别
2026-04-21 v3 人工智能
摘要
在本文中,我们介绍了LLaVA-Octopus,一种新颖的视频多模态大语言模型。LLaVA-Octopus根据用户指令自适应地加权来自不同视觉投影器的特征,使我们能够利用每个投影器的互补优势。我们观察到不同的视觉投影器在处理特定任务时表现出不同的特性。例如,一些投影器擅长捕捉静态细节,而另一些在处理时间信息方面更有效,还有一些更适合需要时间一致性的任务。通过根据用户指令动态调整特征权重,LLaVA-Octopus动态选择并组合最合适的特征,显著增强了模型在多模态任务中的性能。实验结果表明,LLaVA-Octopus在多个基准测试中取得了优异的性能,特别是在视频问答、长视频理解和综合多选基准测试等任务中,展示了其广泛的应用潜力。
引用
@article{arxiv.2501.05067,
title = {LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding},
author = {Boyuan Sun and Jiaxing Zhao and Xiang Chen and Xihan Wei and Qibin Hou},
journal= {arXiv preprint arXiv:2501.05067},
year = {2026}
}
备注
18 pages, 10 figures