中文

OASIS:面向文化背景的多语言多模态口语视觉问答数据集

计算与语言 2026-05-13 v3 人工智能

摘要

大规模多模态模型在视觉问答(VQA)等任务上取得强劲成绩,但在需要文化信息、视觉信息、日常知识,尤其是在稀缺和被边缘化语言中时常受限。我们引入OASIS,一个大规模文化背景感知的多模态QA数据集,涵盖图像、文本和语音。OASIS基于EverydayMMQA构建而成,该框架为创建本地化口语和视觉QA资源提供了可扩展的半自动方法,由多阶段人类在环验证支持。OASIS包含约0.92M张真实图片和14.8M对QA对,其中包括3.7M个口语问题,拥有42名说话者录制的3.7小时语音,以及20K小时的语音克隆语音。它支持四种输入设置:文本-only、语音-only、文本+图像和语音+图像。数据集聚焦于英语和阿拉伯语方言,覆盖18个国家,涵盖现代标准阿拉伯语(MSA)以及各地方方言。它旨在评估模型超越对象识别,针对现实场景中的实用主义、常识和文化背景推理。我们在OASIS上对四个闭源模型、三个开源模型和一个微调模型进行基准测试。该框架和数据集将公开释放以供社区使用。https://huggingface.co/datasets/QCRI/OASIS

关键词

引用

@article{arxiv.2510.06371,
  title  = {OASIS: A Multilingual and Multimodal Dataset for Culturally Grounded Spoken Visual QA},
  author = {Firoj Alam and Ali Ezzat Shahroor and Md. Arid Hasan and Zien Sheikh Ali and Hunzalah Hassan Bhatti and Mohamed Bayan Kmainasi and Shammur Absar Chowdhury and Basel Mousi and Fahim Dalvi and Nadir Durrani and Natasa Milic-Frayling},
  journal= {arXiv preprint arXiv:2510.06371},
  year   = {2026}
}

备注

Multimodal Foundation Models, Large Language Models, Native, Multilingual, Language Diversity, Contextual Understanding, Culturally Informed