少即是多:将线性层作用于 CLIP 特征作为强大的 VizWiz 模型
计算机视觉与模式识别
2022-06-14 v1 计算与语言
机器学习
摘要
当前用于视觉问答等多模态任务的架构因其高复杂性而存在弊端。因此,这些架构难以训练且需要高昂的计算资源。为解决这些问题,我们提出了一种基于 CLIP 的架构,无需对特征提取器进行任何微调。我们在图像与文本编码器的拼接特征上使用一个简单的线性分类器。训练过程中加入了一个作用于答案类型的辅助损失。所得分类结果随后被用作答案类别选择上的注意力门控。在 VizWiz 2022 视觉问答挑战赛中,我们在任务 1(预测视觉问题的答案)上取得了 60.15% 的准确率,在任务 2(预测视觉问题的可答性)上取得了 83.78% 的 AP 分数。
引用
@article{arxiv.2206.05281,
title = {Less Is More: Linear Layers on CLIP Features as Powerful VizWiz Model},
author = {Fabian Deuser and Konrad Habel and Philipp J. Rösch and Norbert Oswald},
journal= {arXiv preprint arXiv:2206.05281},
year = {2022}
}
备注
VizWiz Grand Challenge: Describing Images and Videos Taken by Blind People (CVPR Workshop 2022)