发现未知中的已知:将数据集中的隐式知识转化为视觉问答的显式训练样本
计算机视觉与模式识别
2022-11-10 v2 计算与语言
摘要
视觉问答(VQA)具有挑战性,不仅因为模型须处理多模态信息,还因为收集充足的训练样本极其困难——关于一幅图像可提出的问题实在太多。因此,仅在人类标注样本上训练的 VQA 模型很容易过拟合于所提问的特定问题风格或图像内容,使模型对问题的巨大多样性基本无知。现有方法主要通过引入辅助任务(如视觉定位、循环一致性或去偏)来解决此问题。本文中,我们采取截然不同的思路。我们发现,对已学 VQA 模型而言的许多“未知”实际上在数据集中是隐式“已知”的。例如,在不同图像中询问同一物体的问题很可能是复述;一幅图像中检测到或标注的物体数量已提供了“多少”问题的答案,即便该图像未标注此问题。基于这些洞察,我们提出一个简单的数据增强流程 SimpleAug,将此“已知”知识转化为 VQA 的训练样本。我们表明,这些增强样本可显著提升所学 VQA 模型的性能,不仅在具有语言先验偏移的 VQA-CP 数据集上,也在无此类偏移的 VQA v2 数据集上。我们的方法进一步开启了以原则性方式利用弱标注或未标注图像来增强 VQA 模型的大门。我们的代码与数据公开于 https://github.com/heendung/simpleAUG。
引用
@article{arxiv.2109.06122,
title = {Discovering the Unknown Knowns: Turning Implicit Knowledge in the Dataset into Explicit Training Examples for Visual Question Answering},
author = {Jihyung Kil and Cheng Zhang and Dong Xuan and Wei-Lun Chao},
journal= {arXiv preprint arXiv:2109.06122},
year = {2022}
}
备注
Accepted to EMNLP 2021