Musketeer:基于任务解释提示的多任务视觉语言模型联合训练
计算机视觉与模式识别
2024-03-18 v2 人工智能
计算与语言
摘要
我们提出了一种视觉-语言模型,其参数在所有任务上联合训练,并在多个可能相互干扰的异构任务间完全共享,由此得到我们命名为Musketeer的单一模型。跨异构任务的知识整合由一种称为任务解释提示(TEP)的新特征实现。借助任务输入/输出格式等丰富且结构化的信息,TEP减少了任务间的干扰,使模型能够聚焦于它们的共享结构。凭借单一模型,Musketeer在几乎所有多个任务上取得了与单任务训练的强基线相当或更好的结果。
引用
@article{arxiv.2305.07019,
title = {Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts},
author = {Zhaoyang Zhang and Yantao Shen and Kunyu Shi and Zhaowei Cai and Jun Fang and Siqi Deng and Hao Yang and Davide Modolo and Zhuowen Tu and Stefano Soatto},
journal= {arXiv preprint arXiv:2305.07019},
year = {2024}
}