中文

ConStruct-VL:无数据的持续结构化视觉—语言概念学习

机器学习 2023-03-31 v2 人工智能 计算机视觉与模式识别

摘要

近来,大规模预训练的视觉—语言(VL)基础模型在许多零样本下游任务中展现出显著能力,仅借助简短文本提示即可识别物体并取得有竞争力的结果。然而,研究也表明 VL 模型在结构化 VL 概念(SVLC)推理(如识别物体属性、状态及物体间关系的能力)上仍显脆弱。这导致推理错误,需通过向 VL 模型传授缺失的 SVLC 技能来即时纠正;通常必须使用发现问题所用的私有数据来完成,这自然引出了一种无数据持续(无任务标识)VL 学习设定。本文中,我们引入首个持续无数据结构化 VL 概念学习(ConStruct-VL)基准,并表明其对许多现有无数据持续学习(CL)策略而言颇具挑战。为此,我们提出一种无数据方法,包含新的对抗伪回放(APR)思路,从过往任务模型生成过往任务的对抗性提醒。为高效运用该方法,我们还提出一种持续参数高效的层化 LoRA(LaLo)神经架构,在训练时实现无记忆成本访问所有过往模型。我们表明该方法以多达约 7% 的优势超越所有无数据方法,甚至匹配部分经验回放水平(在须保留数据隐私的应用中不可行)。我们的代码公开于 https://github.com/jamessealesmith/ConStruct-VL。

关键词

引用

@article{arxiv.2211.09790,
  title  = {ConStruct-VL: Data-Free Continual Structured VL Concepts Learning},
  author = {James Seale Smith and Paola Cascante-Bonilla and Assaf Arbelle and Donghyun Kim and Rameswar Panda and David Cox and Diyi Yang and Zsolt Kira and Rogerio Feris and Leonid Karlinsky},
  journal= {arXiv preprint arXiv:2211.09790},
  year   = {2023}
}

备注

Accepted by the 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2023)