中文

跨任务视觉类比学习:通过隐式文本驱动的视觉语言模型

人工智能 2025-11-21 v1

摘要

在大语言模型 (LLM) 中,类比学习指通过对输入上下文中提供的少量演示来完成新任务。近期的视觉类比学习 (VICL) 进展表明,统一的视觉语言模型 (VLM) 能够解决下游任务。当视觉提示和目标图像来自不同的视觉任务时,VLM 能否仍然实现类比学习?本文提出一种全协作管线,即 T2T-VICL,供 VLM 探索跨任务类比学习的潜力。根本上,我们设计一种机制来生成和选择最能隐式描述两种不同低层视觉任务之间差异的文本提示,并构建了第一个跨任务类比学习数据集。基于此,我们提出一种新型推理框架,将感知得分基于推理与传统评估指标结合,以实现跨任务类比学习。我们的做法在十二个跨任务情景中取得领先成绩,在另外九个情景中取得第二梯队水平,开启了 VLM 跨任务类比学习边界的可能性。

关键词

引用

@article{arxiv.2511.16108,
  title  = {SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent},
  author = {Shiyi Cao and Dacheng Li and Fangzhou Zhao and Shuo Yuan and Sumanth R. Hegde and Connor Chen and Charlie Ruan and Tyler Griggs and Shu Liu and Eric Tang and Richard Liaw and Philipp Moritz and Matei Zaharia and Joseph E. Gonzalez and Ion Stoica},
  journal= {arXiv preprint arXiv:2511.16108},
  year   = {2025}
}