中文

LATTE:学习与视觉专家共同思考

计算机视觉与模式识别 2025-09-16 v4

摘要

虽然开源视觉语言模型在简单问答任务中表现良好,但在需要感知与推理能力的复杂问题上仍显不足。我们提出 LATTE 系列视觉语言模型,具备 LeArned to Think wiTh vision spEcialists 的能力。通过将感知任务卸载至领先视觉模型,Our approach enables vision-language models to focus solely on reasoning over high-quality perceptual information. 为训练 LATTE,我们合成并筛选了包含 29.3 万个多模态推理痕迹的数据集,这些痕迹基于视觉专家的感知输出。LATTE 在训练后在涵盖感知与推理能力的 6 个基准测试上取得显著的 4-5% 性能提升。消融研究表明,多模态推理痕迹的有效性取决于数据来源、格式以及思考过程的质量。

关键词

引用

@article{arxiv.2412.05479,
  title  = {LATTE: Learning to Think with Vision Specialists},
  author = {Zixian Ma and Jianguo Zhang and Zhiwei Liu and Jieyu Zhang and Juntao Tan and Manli Shu and Juan Carlos Niebles and Shelby Heinecke and Huan Wang and Caiming Xiong and Ranjay Krishna and Silvio Savarese},
  journal= {arXiv preprint arXiv:2412.05479},
  year   = {2025}
}