QUENCH:衡量 LLM 中印度语系与非印度语系上下文通用推理之间的差距
计算与语言
2024-12-17 v1
摘要
大型语言模型(LLMs)的兴起催生了对超越传统设置的高级基准测试系统的需求。为此,我们引入了 QUENCH,这是一个新颖的基于文本的英语问答基准测试,从 YouTube 问答视频中手动整理和转录而成。QUENCH 包含被掩蔽的实体和理由,供 LLMs 通过生成进行预测。在地理上下文与常识推理的交汇处,QUENCH 有助于通过零样本、开放领域的问答设置评估 LLMs 的世界知识和演绎能力。我们在 7 个 LLMs 和 4 个指标上进行了广泛评估,研究了模型大小、提示风格、地理上下文和黄金标注理由生成的影响。基准测试以 LLMs 易犯的错误分析作为结束。
引用
@article{arxiv.2412.11763,
title = {QUENCH: Measuring the gap between Indic and Non-Indic Contextual General Reasoning in LLMs},
author = {Mohammad Aflah Khan and Neemesh Yadav and Sarah Masud and Md. Shad Akhtar},
journal= {arXiv preprint arXiv:2412.11763},
year = {2024}
}
备注
17 Pages, 6 Figures, 8 Tables, COLING 2025