多语言大语言模型并非多语言思考者:来自印地语类比评估的证据
计算与语言
2025-07-25 v2 人工智能
摘要
类比测试模型推断概念之间隐含关系的能力,使其成为评估推理能力的关键基准。虽然大规模语言模型 (LLM) 在英语中被广泛评估其推理能力,但其在印度语言中的能力仍鲜有研究,这限制了我们理解这些模型是否跨语言泛化的机会。为弥合这一差距,我们引入了新的印地语类比测试集 (HATS),包含 405 个来自印度政府考试的多选问题。我们对各种 prompting strategy 对准 multilingual LLM 进行基准测试,并引入一种基于认知理论的类比推理方法。该方法提高了模型在印地语类比问题上的表现。我们的实验显示,无论采用何种 prompting strategy,模型在英语提示下表现最佳。该测试集解决了评估印地语 LLM 推理能力缺乏关键资源的问题。
引用
@article{arxiv.2507.13238,
title = {Multilingual LLMs Are Not Multilingual Thinkers: Evidence from Hindi Analogy Evaluation},
author = {Ashray Gupta and Rohan Joseph and Sunny Rai},
journal= {arXiv preprint arXiv:2507.13238},
year = {2025}
}