mSCoRe:面向技能驱动的多语言常识推理基准
计算与语言
2025-08-15 v1 人工智能
摘要
近期大型语言模型在复杂推理任务方面取得了显著进展。然而,针对多语言常识推理(涉及不同语言和文化间的日常知识),这些模型如何利用不同人类推理技能仍 poorly 被研究。为此,我们提出了 \textbf{M}ultilingual and Scalable Benchmark for \textbf{S}kill-based \textbf{Co}mmonsense \textbf{Re}asoning (\textbf{mSCoRe})。本基准包含三个关键组件:(1) 一种新颖的推理技能分类体系,使我们能够细粒度地分析模型的推理过程;(2) 专为常识推理评估设计的稳健数据合成管道;(3) 允许任务难度随 LLM 技能提升而动态扩展的复杂度扩展框架。对八个最新 SOTA LLM进行大量实验表明,\textbf{mSCoRe} 对当前模型仍具有显著挑战性,尤其在更高的复杂度水平下。我们的结果揭示了当面对细微的多语言常识与文化背景时,这类受推理强化的模型存在的局限性。我们进一步对模型的推理过程进行了详细分析,为改进多语言常识推理能力指明了未来的方向。
引用
@article{arxiv.2508.10137,
title = {mSCoRe: a $M$ultilingual and Scalable Benchmark for $S$kill-based $Co$mmonsense $Re$asoning},
author = {Nghia Trung Ngo and Franck Dernoncourt and Thien Huu Nguyen},
journal= {arXiv preprint arXiv:2508.10137},
year = {2025}
}