从通用到专用:通过任务特定视觉指令调优适应视觉语言模型
计算机视觉与模式识别
2024-10-10 v1
摘要
大型视觉语言模型(VLM)将大型语言模型与视觉编码器结合,展示出在各种任务上的潜力。然而,它们往往在特定于任务的应用中表现不佳,这是由于预训练和微调之间存在领域差距。我们引入VITask,一种新框架,通过集成任务特定模型(TSM)来增强VLM在特定任务中的适应性。VITask采用三种关键策略:exemplar prompting(EP)、response distribution alignment(RDA)和contrastive response tuning(CRT),以调整其响应分布来提高VLM在特定任务上的性能。EP允许TSM特征引导VLM,而RDA使VLM在推理时无需TSM即可通过学习从exemplar提示的模型中适应。CRT进一步优化正确的图像-响应对的排序,从而降低生成不希望的响应的风险。在12个医学诊断数据集(覆盖9种影像模态)上的实验表明,VITask优于基于vanilla instruction-tuned VLM和TSM,展示了其有效集成两种模型互补特征的能力。此外,VITask提供了灵活的TSM集成和对不完整指令的鲁棒性,使其成为通用且高效的特定VLM调优解决方案。我们的代码可在 https://github.com/baiyang4/VITask 查看。
引用
@article{arxiv.2410.06456,
title = {From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning},
author = {Yang Bai and Yang Zhou and Jun Zhou and Rick Siow Mong Goh and Daniel Shu Wei Ting and Yong Liu},
journal= {arXiv preprint arXiv:2410.06456},
year = {2024}
}