Reveal-Bangla:一个用于跨语言多步推理评估的数据集
计算与语言
2025-12-04 v3
摘要
语言模型在复杂的多步推理任务上表现出了卓越的性能。然而,对其评估主要局限于英语等高资源语言。在本文中,我们引入了一个基于英语Reveal数据集人工翻译的孟加拉语多步推理数据集,该数据集包含二元和非二元问题类型。我们对以英语为中心和以孟加拉语为中心的多语言小型语言模型在原始数据集和我们翻译的版本上进行了对照评估,以比较它们利用相关推理步骤产生正确答案的能力。我们的结果表明,在可比较的设置下,推理上下文对于更具挑战性的非二元问题是有益的,但模型难以有效利用相关的孟加拉语推理步骤。最后,我们探讨了推理步骤如何影响模型的预测,并强调了不同模型和语言之间的不同趋势。
引用
@article{arxiv.2508.08933,
title = {Reveal-Bangla: A Dataset for Cross-Lingual Multi-Step Reasoning Evaluation},
author = {Khondoker Ittehadul Islam and Gabriele Sarti},
journal= {arXiv preprint arXiv:2508.08933},
year = {2025}
}
备注
Accepted at BLP workshop @ IJCNLP-AACL 2025