ConStruct-VL:无数据的持续结构化视觉—语言概念学习
机器学习
2023-03-31 v2 人工智能
计算机视觉与模式识别
摘要
近来,大规模预训练的视觉—语言(VL)基础模型在许多零样本下游任务中展现出显著能力,仅借助简短文本提示即可识别物体并取得有竞争力的结果。然而,研究也表明 VL 模型在结构化 VL 概念(SVLC)推理(如识别物体属性、状态及物体间关系的能力)上仍显脆弱。这导致推理错误,需通过向 VL 模型传授缺失的 SVLC 技能来即时纠正;通常必须使用发现问题所用的私有数据来完成,这自然引出了一种无数据持续(无任务标识)VL 学习设定。本文中,我们引入首个持续无数据结构化 VL 概念学习(ConStruct-VL)基准,并表明其对许多现有无数据持续学习(CL)策略而言颇具挑战。为此,我们提出一种无数据方法,包含新的对抗伪回放(APR)思路,从过往任务模型生成过往任务的对抗性提醒。为高效运用该方法,我们还提出一种持续参数高效的层化 LoRA(LaLo)神经架构,在训练时实现无记忆成本访问所有过往模型。我们表明该方法以多达约 7% 的优势超越所有无数据方法,甚至匹配部分经验回放水平(在须保留数据隐私的应用中不可行)。我们的代码公开于 https://github.com/jamessealesmith/ConStruct-VL。
引用
@article{arxiv.2211.09790,
title = {ConStruct-VL: Data-Free Continual Structured VL Concepts Learning},
author = {James Seale Smith and Paola Cascante-Bonilla and Assaf Arbelle and Donghyun Kim and Rameswar Panda and David Cox and Diyi Yang and Zsolt Kira and Rogerio Feris and Leonid Karlinsky},
journal= {arXiv preprint arXiv:2211.09790},
year = {2023}
}
备注
Accepted by the 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2023)