谜语之影:基于印度谜语评估多语言LLM的推理与自我意识
计算与语言
2025-11-05 v2 人工智能
摘要
大型语言模型(LLM)在非英语语言上执行文化嵌入推理的能力仍未得到充分探索。本文考察了LLM在七种主要印度语言(孟加拉语、古吉拉特语、印地语、卡纳达语、马拉拉姆语、泰米尔语和泰卢固语)上的推理与自我评估能力。我们引入包含传统谜语与情境重构变体的多语言谜语数据集,评估了Gemini 2.5 Pro、Gemini 2.5 Flash、Mistral-Saba、LLaMA 4 Scout和LLaMA 4 Maverick等五种LLM在七种提示策略下的表现。在第一阶段,我们评估谜语解答表现,发现Gemini 2.5 Pro整体表现最佳,少样本方法仅带来有限提升,且准确率在不同语言间存在显著差异。在第二阶段,我们进行自评估实验以衡量推理一致性。结果揭示关键发现:模型初始准确率与其识别自身错误能力呈负相关。表现最好的模型如Gemini 2.5 Pro过于自信(True Negative Rate为4.34%),而表现较低的模型如LLaMA 4 Scout则相当自我意识(True Negative Rate为42.09%)。这些结果凸显了多语言推理中的显著差距,强调需要既能有效推理又能认识自身局限性的模型。
引用
@article{arxiv.2511.00960,
title = {The Riddle of Reflection: Evaluating Reasoning and Self-Awareness in Multilingual LLMs using Indian Riddles},
author = {Abhinav P M and Ojasva Saxena and Oswald C and Parameswari Krishnamurthy},
journal= {arXiv preprint arXiv:2511.00960},
year = {2025}
}