Machine Learning · Computer Science
INDIC QA BENCHMARK: A Multilingual Benchmark to Evaluate Question Answering capability of LLMs for Indic Languages
Abhishek Kumar Singh, Vishwajeet kumar, Rudra Murthy, Jaydeep Sen +2
2025-02-25
Computation and Language · Computer Science
HinTel-AlignBench: A Framework and Benchmark for Hindi-Telugu with English-Aligned Samples
Rishikant Chigrupaatii, Ponnada Sai Tulasi Kanishka, Lalit Chandra Routhu, Martin Patel Sama Supratheek Reddy +5
2025-11-20
Computation and Language · Computer Science
PARIKSHA: A Large-Scale Investigation of Human-LLM Evaluator Agreement on Multilingual and Multi-Cultural Data
Ishaan Watts, Varun Gumma, Aditya Yadavalli, Vivek Seshadri +2
2024-10-21
Computation and Language · Computer Science
IndicParam: Benchmark to evaluate LLMs on low-resource Indic Languages
Ayush Maheshwari, Kaushal Sharma, Vivek Patel, Aditya Maheshwari
2026-01-13
Computation and Language · Computer Science
Building pre-train LLM Dataset for the INDIC Languages: a case study on Hindi
Shantipriya Parida, Shakshi Panwar, Kusum Lata, Sanskruti Mishra +1
2024-07-16
Computation and Language · Computer Science
IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages
Harman Singh, Nitish Gupta, Shikhar Bharadwaj, Dinesh Tewari +1
2024-08-09
Computation and Language · Computer Science
IndicEval: A Bilingual Indian Educational Evaluation Framework for Large Language Models
Saurabh Bharti, Gaurav Azad, Abhinaw Jagtap, Nachiket Tapas
2026-02-19
Computation and Language · Computer Science
BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks
Anna Sokol, Elizabeth Daly, Michael Hind, David Piorkowski +3
2025-06-04
Computation and Language · Computer Science
Evaluating LLMs' Multilingual Capabilities for Bengali: Benchmark Creation and Performance Analysis
Shimanto Bhowmik, Tawsif Tashwar Dipto, Md Sazzad Islam, Sheryl Hsu +1
2025-08-01
Computation and Language · Computer Science
HEALTH-PARIKSHA: Assessing RAG Models for Health Chatbots in Real-World Multilingual Settings
Varun Gumma, Ananditha Raghunath, Mohit Jain, Sunayana Sitaram
2025-12-02
Machine Learning · Computer Science
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
Eunsu Kim, Haneul Yoo, Guijin Son, Hitesh Patel +2
2025-06-03
Computation and Language · Computer Science
Analysis of Indic Language Capabilities in LLMs
Aatman Vaidya, Tarunima Prabhakar, Denny George, Swair Shah
2025-01-24
Computation and Language · Computer Science
Improving Multilingual Capabilities with Cultural and Local Knowledge in Large Language Models While Enhancing Native Performance
Ram Mohan Rao Kadiyala, Siddartha Pullakhandam, Siddhant Gupta, Drishti Sharma +5
2025-08-01
Computation and Language · Computer Science
Beyond Specialization: Benchmarking LLMs for Transliteration of Indian Languages
Gulfarogh Azam, Mohd Sadique, Saif Ali, Mohammad Nadeem +3
2025-05-27
Computation and Language · Computer Science
Building Benchmarks from the Ground Up: Community-Centered Evaluation of LLMs in Healthcare Chatbot Settings
Hamna Hamna, Gayatri Bhat, Sourabrata Mukherjee, Faisal Lalani +4
2026-03-16
Computation and Language · Computer Science
IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian Languages
Mohammed Safi Ur Rahman Khan, Priyam Mehta, Ananth Sankar, Umashankar Kumaravelan +8
2024-12-02
Computation and Language · Computer Science
Enterprise Benchmarks for Large Language Model Evaluation
Bing Zhang, Mikio Takeuchi, Ryo Kawahara, Shubhi Asthana +4
2024-10-18
Computation and Language · Computer Science
Breaking Language Barriers: Equitable Performance in Multilingual Language Models
Tanay Nagar, Grigorii Khvatskii, Anna Sokol, Nitesh V. Chawla
2025-08-19
Computation and Language · Computer Science
Revisiting Metric Reliability for Fine-grained Evaluation of Machine Translation and Summarization in Indian Languages
Amir Hossein Yari, Kalmit Kulkarni, Ahmad Raza Khan, Fajri Koto
2025-10-09
Computation and Language · Computer Science
Towards Large Language Model driven Reference-less Translation Evaluation for English and Indian Languages
Vandan Mujadia, Pruthwik Mishra, Arafat Ahsan, Dipti Misra Sharma
2024-04-04
Computation and Language · Computer Science
L3Cube-IndicQuest: A Benchmark Question Answering Dataset for Evaluating Knowledge of LLMs in Indic Context
Pritika Rohera, Chaitrali Ginimav, Akanksha Salunke, Gayatri Sawant +1
2024-10-31
Computation and Language · Computer Science
HiMed: Incentivizing Hindi Reasoning in Medical LLMs
Dingfeng Jiang, Han Yan, Chenze Ma, Amit Kumar Jaiswal +11
2026-05-26