中文

优、更优、最佳:基于强化学习的多选视觉问答文本干扰项生成

计算机视觉与模式识别 2022-04-20 v3 计算与语言

摘要

多选视觉问答(VQA)近期引起了研究人员和终端用户越来越多的关注。随着自动构建大规模多选 VQA 数据的需求增长,我们引入了一项称为 VQA 文本干扰项生成(DG-VQA)的新任务,专注于在给定上下文图像、问题和正确答案的情况下生成具有挑战性且有意义的干扰项。DG-VQA 任务旨在无需真实训练样本地生成干扰项,因为此类资源十分稀缺。为无监督地解决 DG-VQA,我们提出了 Gobbet,一个基于强化学习(RL)的框架,利用预训练 VQA 模型作为替代知识库来引导干扰项生成过程。在 Gobbet 中,预训练 VQA 模型作为 RL 设置中的环境,为输入多模态查询提供反馈,而神经干扰项生成器作为智能体相应地采取动作。我们提出使用现有 VQA 模型性能下降作为生成干扰项质量的指标。另一方面,我们通过数据增强实验展示了生成干扰项的效用,因为当 AI 模型应用于不可预测的开放域场景或安全敏感应用时,鲁棒性愈发重要。我们进一步对 Gobbet 生成的干扰项能欺骗现有模型的因素进行了人工案例研究。

关键词

引用

@article{arxiv.1910.09134,
  title  = {Good, Better, Best: Textual Distractors Generation for Multiple-Choice Visual Question Answering via Reinforcement Learning},
  author = {Jiaying Lu and Xin Ye and Yi Ren and Yezhou Yang},
  journal= {arXiv preprint arXiv:1910.09134},
  year   = {2022}
}