Macaron:基于模板填充的受控人类编写多语言多文化推理基准
计算与语言
2026-04-21 v2
摘要
多语言基准很少测试文化相关前提下的推理:翻译后的数据集保留了以英语为中心的情景,而以文化为中心的数据集往往缺乏对所需推理类型的控制。我们提出 Macaron,一个以模板为导向的基准,将推理类型与文化方面进行因子化分离。使用 100 个语言无关模板覆盖 7 种推理类型和 22 个文化方面,由本地标注者创建与情景相吻合的英语和当地语言多选题,并系统地从 mask-heatmap 叠加中派生出 True/False 题目。Macaron 包含 11,862 个实例,覆盖 20 个国家/文化背景、10 种书写体系和 20 种语言和方言(包括低资源语言如 Amharic、Yoruba、Zulu、Kyrgyz 以及一些阿拉伯方言)。在 21 个多语言 LLM 的零样评估中,推理模式模型实现了最强的性能(整体 80.8%),且在英语和当地语言之间实现了接近一致的表现;而开源权重模型在当地语言方面会显著下降,甚至在 T/F 题目中接近随机水平。始终是最难的为以文化为基础的数学和计数模板。数据可在 https://huggingface.co/datasets/AlaaAhmed2444/Macaron 访问。
引用
@article{arxiv.2602.10732,
title = {Macaron: Controlled, Human-Written Benchmark for Multilingual and Multicultural Reasoning via Template-Filling},
author = {Alaa Elsetohy and Sama Hadhoud and Haryo Akbarianto Wibowo and Chenxi Whitehouse and Genta Indra Winata and Fajri Koto and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2602.10732},
year = {2026}
}