中文

BhashaBench V1:面向印度领域四象限的综合基准

计算与语言 2025-10-31 v2 人工智能

摘要

大语言模型(LLM)的快速发展加剧了域特定和文化特定评估的需求。现有基准大多以英语为中心且域中立,限制了其适用于印度语境的效果。为弥合这一差距,我们引入 BhashaBench V1,首个聚焦于关键印度知识体系的域特定、多任务、双语基准。BhashaBench V1 包含 74,166 个精心策划的问答对,其中 52,494 个英文,21,672 个印地语,来源于真实政府和专业考试。它涵盖四大领域:农业、法律、金融和阿育吠陀, comprising 90+ 子领域,覆盖 500+ 主题,实现细粒度评估。对 29+ LLM 的评估揭示了显著的域和语言特定性能差异,尤其在资源匮乏领域差距更大。例如,GPT-4o 在法律领域实现 76.49% 的总体准确率,但在阿育吠陀仅为 59.74%。模型在所有领域中对英文内容的表现均优于印地语。子领域分析显示,Cyber Law、International Finance 等区域表现相对较好,而 Panchakarma、Seed Science 和 Human Rights 仍显著薄弱。BhashaBench V1 为评估大语言模型在印度多元知识领域提供了全面数据集,使其能够评估模型将域特定知识与双语理解能力相结合的能力。所有代码、基准和资源均公开可用,以支持开放研究。

关键词

引用

@article{arxiv.2510.25409,
  title  = {BhashaBench V1: A Comprehensive Benchmark for the Quadrant of Indic Domains},
  author = {Vijay Devane and Mohd Nauman and Bhargav Patel and Aniket Mahendra Wakchoure and Yogeshkumar Sant and Shyam Pawar and Viraj Thakur and Ananya Godse and Sunil Patra and Neha Maurya and Suraj Racha and Nitish Kamal Singh and Ajay Nagpal and Piyush Sawarkar and Kundeshwar Vijayrao Pundalik and Rohit Saluja and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2510.25409},
  year   = {2025}
}