中文

VQA训练集是生成少样本池的自对弈环境

计算机视觉与模式识别 2024-05-31 v1

摘要

大语言模型和大视觉模型越来越能够解决组合推理任务,这通过视觉问答基准测试的突破来衡量。然而,最先进的解决方案通常涉及精心构建大型预训练和微调数据集,这可能成本高昂。使用外部工具,无论是其他机器学习模型、搜索引擎还是API,都可以通过将高级推理问题分解为可由单个工具回答的子问题来显著提高性能,但这种方法在教导微调模型如何使用可用工具方面具有类似的数据集构建成本。我们提出了一种技术,其中现有的训练集可以直接用于构建具有任务指标作为奖励的计算环境。这使得模型能够自主地教会自己使用自身或另一个模型作为工具。通过这样做,我们通过整合外部信号来增强训练集。所提出的方法从零样本提示开始,并通过选择在训练集上最大化任务指标的少样本示例来迭代地优化它们。我们的实验展示了Gemini如何学习使用自身或另一个更小、更专业的模型(如ScreenAI)来迭代地提高在训练集上的性能。我们的方法成功地在图表、信息图和文档视觉问答数据集上泛化并改进了零样本性能。

关键词

引用

@article{arxiv.2405.19773,
  title  = {VQA Training Sets are Self-play Environments for Generating Few-shot Pools},
  author = {Tautvydas Misiunas and Hassan Mansoor and Jasper Uijlings and Oriana Riva and Victor Carbune},
  journal= {arXiv preprint arXiv:2405.19773},
  year   = {2024}
}