少样本视觉问题生成:一项新任务与基准数据集
计算机视觉与模式识别
2023-01-09 v2
摘要
从视觉场景生成自然语言问题,称为视觉问题生成(VQG),在最近已被探索,其中大量精细标注的数据提供了训练语料。然而,在实践中,仅有少量带有对应少数答案类型的问题标注的图像并不罕见。在本文中,我们提出了一项新颖且具挑战性的少样本视觉问题生成(FS-VQG)任务,并为其提供了全面的基准。具体而言,我们评估了各种现有 VQG 方法以及基于元学习和自监督策略的流行少样本解决方案在 FS-VQG 任务上的表现。我们在两个流行的现有数据集 VQG 和 Visual7w 上进行了实验。此外,我们还清理并扩展了 VQG 数据集以用于少样本场景,增加了图像-问题对以及额外的答案类别。我们将这个新数据集称为 VQG-23。我们的实验得出了若干重要发现,揭示了当前模型在少样本视觉与语言生成任务中的局限。我们发现,将现有 VQG 方法简单地通过迁移学习或元学习进行扩展可能不足以应对少样本 VQG 中的固有挑战。我们相信这项工作将有助于加速少样本学习研究的进展。
引用
@article{arxiv.2210.07076,
title = {Few-Shot Visual Question Generation: A Novel Task and Benchmark Datasets},
author = {Anurag Roy and David Johnson Ekka and Saptarshi Ghosh and Abir Das},
journal= {arXiv preprint arXiv:2210.07076},
year = {2023}
}