DRISHTIKON:用于测试语言模型对印度文化理解的多模态多语言基准
计算与语言
2025-09-24 v1 多媒体
摘要
我们推出了DRISHTIKON,这是首个完全以印度文化为中心的多模态多语言基准,旨在评估生成式AI系统的文化理解能力。与具有通用或全球范围的现有基准不同,DRISHTIKON对印度各地区提供了深入、细粒度的覆盖,涵盖15种语言,覆盖所有邦和联邦属地,并包含超过64,000个对齐的文本-图像对。该数据集捕捉了丰富的文化主题,包括节日、服饰、美食、艺术形式和历史遗产等。我们在零样本和思维链设置下评估了广泛的视觉语言模型(VLM),包括开源的小型与大型模型、专有系统、推理专用VLM以及面向印度语言的模型。我们的结果揭示了当前模型在基于文化背景的多模态输入上进行推理的关键局限性,特别是在低资源语言和较少被记录的传统方面。DRISHTIKON填补了包容性AI研究中的重要空白,为推进具备文化感知和多模态能力的语言技术提供了稳健的测试平台。
引用
@article{arxiv.2509.19274,
title = {DRISHTIKON: A Multimodal Multilingual Benchmark for Testing Language Models' Understanding on Indian Culture},
author = {Arijit Maji and Raghvendra Kumar and Akash Ghosh and Anushka and Nemil Shah and Abhilekh Borah and Vanshika Shah and Nishant Mishra and Sriparna Saha},
journal= {arXiv preprint arXiv:2509.19274},
year = {2025}
}
备注
EMNLP MAINS 2025