HinTel-AlignBench:面向印度语-泰卢固语的AI辅助基准框架
计算与语言
2025-11-20 v1 机器学习
摘要
近15亿人口和120多个主要语言的印度是世界上最具多样性的地区之一。随着多语言视觉语言模型(VLM)的流行,对于低资源语言的公平AI需要完善的评估方法。当前的多语言VLM评估存在四个主要局限:依赖未经验证的自动翻译、任务/领域覆盖范围有限、样本规模不足以及缺乏来自印度语言的文化和本土化问答(QA)。为解决这些问题,本文提出了一个可扩展的框架,用于评估印度语言的VLM并将其与英语性能进行比较。使用该框架,我们生成HinTel-AlignBench,一个来自印度语和泰卢固语的基准,包含与英语对齐的样本。我们的贡献有三点:(1)一种半自动数据创建框架,结合回译、筛选和人工验证;(2)为印度语和泰卢固语提供最全面的视觉语言基准,包括适配英语数据集(VQAv2、RealWorldQA、CLEVR-Math)和本土新型印度数据集(JEE用于STEM、VAANI用于文化 grounding),每个语言约有4000个QA对;(3)对各种最先进(SOTA)开源和闭源VLM的详细性能分析。我们发现对于所有模型在5个任务中,印地语和泰卢固语的性能相对于英语都存在退化,印地语平均退化8.3分,泰卢固语平均退化5.5分。我们归类了常见的失败模式,以突出多模态理解的具体改进领域。
引用
@article{arxiv.2511.15183,
title = {HinTel-AlignBench: A Framework and Benchmark for Hindi-Telugu with English-Aligned Samples},
author = {Rishikant Chigrupaatii and Ponnada Sai Tulasi Kanishka and Lalit Chandra Routhu and Martin Patel Sama Supratheek Reddy and Divyam Gupta and Dasari Srikar and Krishna Teja Kuchimanchi and Rajiv Misra and Rohun Tripathi},
journal= {arXiv preprint arXiv:2511.15183},
year = {2025}
}