SANSKRITI:评估语言模型对印度文化理解的综合基准
计算与语言
2025-10-29 v2
摘要
语言模型(LMs)是塑造现代工作流程的必备工具,但其全球效能取决于理解当地的社会文化背景。为此,我们引入SANSKRITI,一个旨在评估语言模型对印度多样性丰富文化理解的基准测试。该基准包含21,853组精心挑选的问答对,覆盖28个州和8个联邦 territories,SANSKRITI是测试印度文化知识规模最大的数据集。它涵盖印度文化十六个关键属性:仪式与典礼、历史、旅游、饮食、舞蹈与音乐、服饰、语言、艺术、节日、宗教、医学、交通、体育、夜生活和人物,全面代表了印度文化的编织。我们在领先的大型语言模型(LLMs)、印度语言模型(ILMs)和小型语言模型(SLMs)上评估SANSKRITI,揭示了其处理文化细微查询能力存在显著差异,许多模型在地域特定情境中表现不佳。通过提供一个广泛、富有文化色彩且多样化的数据集,SANSKRITI为评估和改进语言模型的文化理解设立了新标准。
引用
@article{arxiv.2506.15355,
title = {SANSKRITI: A Comprehensive Benchmark for Evaluating Language Models' Knowledge of Indian Culture},
author = {Arijit Maji and Raghvendra Kumar and Akash Ghosh and Anushka and Sriparna Saha},
journal= {arXiv preprint arXiv:2506.15355},
year = {2025}
}
备注
ACL 2025 Findings