大语言模型能否解答我祖母的谜语?评估多语言大语言模型在推理传统孔加语谜题方面的能力
计算与语言
2025-12-24 v1
摘要
大型语言模型(LLM)在许多自然语言处理基准测试中展现出惊人的性能,但其在拟人化、文化特定且资源匮乏环境下的推理能力仍受到 insufficient 探索。我们针对孔加语(Bangla) introducing BanglaRiddleEval,一个包含 1,244 道传统孔加语谜题的基准测试,覆盖四个任务(共 4,976 个谜题-任务 artifact)。基于 LLM 的管道,我们生成链式思考解释、语义连贯的干扰项以及细粒度歧义注释,对评估 diverse 的开源和闭源模型在不同提示策略下的表现。模型在生成式问答上实现适度的语义重叠但正确性较低,选择题准确率仅达约 56%,人类基准为 83%;歧义解决率在约 26% 到 68% 之间,高质量解释仅限于最强模型。这些结果表明当前 LLM 捕获了一些完成孔加语谜题推理所需的线索,但距离人类水平还很远, establishing BanglaRiddleEval 作为低资源拟人化推理的挑战性新基准。所有数据、代码和评估脚本均已在 GitHub 上提供:https://github.com/Labib1610/BanglaRiddleEval。
引用
@article{arxiv.2512.20324,
title = {Can LLMs Solve My Grandma's Riddle? Evaluating Multilingual Large Language Models on Reasoning Traditional Bangla Tricky Riddles},
author = {Nurul Labib Sayeedi and Md. Faiyaz Abdullah Sayeedi and Khushnur Binte Jahangir and Swakkhar Shatabda and Sarah Masud Preum},
journal= {arXiv preprint arXiv:2512.20324},
year = {2025}
}