迈向通用视觉系统
计算机视觉与模式识别
2022-04-21 v2 人工智能
计算与语言
机器学习
摘要
当今的计算机视觉系统主要是 N 用途系统,针对一组预定义任务设计与训练。使此类系统适应新任务颇具挑战,且常需要对网络架构(如添加新输出头)或训练过程(如添加新损失)进行非平凡修改。为减少开发新应用所需的时间与专业知识,我们期望创建通用视觉系统,其可在不对架构或学习过程作任何修改的情况下学习并执行一系列任务。本文提出 GPV-1,一种任务无关的视觉-语言架构,能够学习并执行涉及接收图像并生成文本和/或边界框的任务,包括分类、定位、视觉问答、图像描述等。我们还提出对架构通用性、技能-概念迁移及学习效率的评估,以期为通用视觉的未来工作提供参考。我们的实验表明 GPV-1 在多项任务上有效,能在任务间复用部分概念知识,可零样本执行指代表达任务,并能利用少量训练样本进一步提升零样本性能。
引用
@article{arxiv.2104.00743,
title = {Towards General Purpose Vision Systems},
author = {Tanmay Gupta and Amita Kamath and Aniruddha Kembhavi and Derek Hoiem},
journal= {arXiv preprint arXiv:2104.00743},
year = {2022}
}
备注
CVPR 2022 Oral; Project page: https://prior.allenai.org/projects/gpv