中文

用于评估多模态定位中跨数据集偏移的提问生成

计算机视觉与模式识别 2022-01-25 v1

摘要

视觉问答(VQA)是回答关于输入图像的自然语言问题的多模态任务。通过跨数据集自适应方法,可以将知识从训练样本较多的源数据集迁移到训练集有限的目标数据集。假设在一个数据集训练集上训练的 VQA 模型无法适应另一个数据集,由于可能存在图像分布不匹配和问题分布不匹配等多种原因,很难确定领域不匹配的根本原因。在加州大学洛杉矶分校,我们正在开发一个 VQG 模块,该模块有助于自动生成 OOD 偏移,从而辅助系统性地评估 VQA 模型的跨数据集自适应能力。

关键词

引用

@article{arxiv.2201.09639,
  title  = {Question Generation for Evaluating Cross-Dataset Shifts in Multi-modal Grounding},
  author = {Arjun R. Akula},
  journal= {arXiv preprint arXiv:2201.09639},
  year   = {2022}
}