中文

源自在线社区的全真实视觉问答数据集

计算机视觉与模式识别 2024-07-18 v4

摘要

视觉问答(VQA)旨在回答关于图像的问题。我们引入了首个所有内容均源自真实用例的 VQA 数据集。该数据集取自在线问答社区论坛,我们称之为 VQAonline。我们刻画了该数据集及其与八个主流 VQA 数据集的关系。观察到我们数据集中的答案往往长得多(即平均 173 词),因而与标准 VQA 评估指标不兼容,我们转而利用流行的长文本评估指标在 VQAonline 上评估六个最先进的 VQA 模型,并报告它们最吃力的地方。最后,我们分析了哪些评估指标与人类判断最为一致。为便于未来扩展,我们在 https://vqaonline.github.io/ 公开共享该数据集。

关键词

引用

@article{arxiv.2311.15562,
  title  = {Fully Authentic Visual Question Answering Dataset from Online Communities},
  author = {Chongyan Chen and Mengchen Liu and Noel Codella and Yunsheng Li and Lu Yuan and Danna Gurari},
  journal= {arXiv preprint arXiv:2311.15562},
  year   = {2024}
}