少样本多模态多任务多语言学习
机器学习
2023-03-23 v1 人工智能
计算与语言
计算机视觉与模式识别
多媒体
摘要
尽管少样本学习作为一种迁移学习范式在有限数据场景中获得了显著关注,但其主要在构建单模态与单语言模型的背景下被探索。此外,现有少样本多任务学习文献的相当部分采用上下文学习,其需要人工生成的提示作为输入,因人工提示工程水平不同而产生波动结果。而且,上下文学习承受着可观的计算、内存与存储成本,并因每次预测都需将提示中所有样本过一遍模型而导致高推理延迟。相比之下,基于微调范式迁移学习的方法以按任务微调权重的一次性成本避免了上述问题。然而,此类方法未涉及少样本多模态多任务学习。本文中,我们通过对预训练视觉与语言模型使用任务特定超网络并对比微调来适配,从而实现少样本多模态多任务多语言(FM3)设定下的少样本学习。FM3架构结合了上下文与基于微调学习两者的优势,由三大组件构成:(i)多模态对比微调以实现少样本学习,(ii)超网络任务适配以执行多任务学习,(iii)任务特定输出头以适配大量多样任务。FM3学习了视觉与语言领域及其交叉中最显著的任务,即视觉蕴涵(VE)、视觉问答(VQA)与自然语言理解(NLU)任务如神经实体识别(NER)及包含QNLI、MNLI、QQP与SST-2的GLUE基准。
引用
@article{arxiv.2303.12489,
title = {Few-shot Multimodal Multitask Multilingual Learning},
author = {Aman Chadha and Vinija Jain},
journal= {arXiv preprint arXiv:2303.12489},
year = {2023}
}