解释性指令:面向统一视觉任务理解与零样本泛化
计算机视觉与模式识别
2025-05-27 v3
摘要
计算机视觉(CV)尽管遵循许多自然语言处理(NLP)中确立的里程碑,如大型 transformer 模型、广泛的预训练和自回归范式等,但尚未完全实现零样本任务泛化。本文探讨 CV 采用离散和术语化任务定义(例如,“图像分割”)这一事实,可能是零样本任务泛化的关键障碍。我们的假设是,由于这些术语化定义导致模型未能真正理解已见任务,深层模型难以泛化到新任务。为验证此假设,我们引入解释性指令,通过从输入图像到输出的详细语言转换来定义 CV 任务目标。我们构建了一个大型数据集,包含 1200 万个“图像输入 解释性指令 输出”三元组,并训练一个基于自回归的视觉语言模型(AR-based VLM),同时接受图像和解释性指令作为输入。通过学习遵循这些指令,AR-based VLM 能够在已见任务上实现指令级的零样本能力,并在未见 CV 任务上 demonstrate 出强大的零样本泛化能力。代码和数据集将在我们的 GitHub 仓库中公开。
引用
@article{arxiv.2412.18525,
title = {Explanatory Instructions: Towards Unified Vision Tasks Understanding and Zero-shot Generalization},
author = {Yang Shen and Xiu-Shen Wei and Yifan Sun and Yuxin Song and Tao Yuan and Jian Jin and Heyang Xu and Yazhou Yao and Errui Ding},
journal= {arXiv preprint arXiv:2412.18525},
year = {2025}
}
备注
ICML'25, 44 pages