SimpsonsVQA:利用定制数据集增强探究式学习
计算机视觉与模式识别
2024-10-31 v1
摘要
视觉问答(VQA)已成为开发基于人工智能的系统以促进交互式和沉浸式学习的一个有前景的研究领域。众多 VQA 数据集已被引入以支持各种任务,例如回答问题或识别无法回答的问题。然而,这些数据集大多使用真实世界图像构建,现有模型在卡通图像上的性能在很大程度上尚未被探索。因此,在本文中,我们提出了“SimpsonsVQA”,一个源自《辛普森一家》电视剧的新型 VQA 数据集,旨在促进探究式学习。我们的数据集专门设计用于不仅解决传统的 VQA 任务,还能识别与图像无关的问题,以及处理用户提供答案、系统必须进行评估(例如,判断为正确、错误或模糊)的反向场景。它旨在满足各种视觉应用的需求,利用《辛普森一家》的视觉内容创建引人入胜且信息丰富的交互式系统。SimpsonsVQA 包含约 23K 张图像、166K 个问答对和 500K 个判断(https://simpsonsvqa.org)。我们的实验表明,当前的大型视觉-语言模型(如 ChatGPT4o)在所有三项任务的零样本设置下均表现不佳,突显了该数据集在提升模型在卡通图像上性能的价值。我们期待 SimpsonsVQA 能够激发探究式学习 VQA 领域的进一步研究、创新和进步。
引用
@article{arxiv.2410.22648,
title = {SimpsonsVQA: Enhancing Inquiry-Based Learning with a Tailored Dataset},
author = {Ngoc Dung Huynh and Mohamed Reda Bouadjenek and Sunil Aryal and Imran Razzak and Hakim Hacid},
journal= {arXiv preprint arXiv:2410.22648},
year = {2024}
}