Prismer:一种带多任务专家视觉-语言模型
机器学习
2024-01-22 v3 人工智能
计算机视觉与模式识别
摘要
近期的视觉-语言模型已展现出令人印象深刻的多模态生成能力。然而,它们通常需要在海量数据上训练庞大模型。作为更具可扩展性的替代方案,我们提出 Prismer,一种数据与参数高效的视觉-语言模型,其利用了任务特定专家的集合。Prismer 仅需训练少量组件,网络权重大部分继承自多个现成可用的预训练专家,并在训练中保持冻结。通过利用来自广泛领域的专家,我们展示 Prismer 能高效汇聚该专家知识并适配各类视觉-语言推理任务。在实验中,我们表明 Prismer 取得了与当前最优方法竞争的微调与少样本学习性能,同时所需训练数据至多减少两个数量级。代码见 https://github.com/NVlabs/prismer。
引用
@article{arxiv.2303.02506,
title = {Prismer: A Vision-Language Model with Multi-Task Experts},
author = {Shikun Liu and Linxi Fan and Edward Johns and Zhiding Yu and Chaowei Xiao and Anima Anandkumar},
journal= {arXiv preprint arXiv:2303.02506},
year = {2024}
}
备注
Published at TMLR 2024. Project Page: https://shikun.io/projects/prismer Code: https://github.com/NVlabs/prismer