中文

弥合文化差距:面向低资源语言中数学应用题社会文化本地化的LLM驱动框架

计算与语言 2026-04-21 v4

摘要

大型语言模型(LLM)在解决以自然语言表达的数学问题方面展现了显著的能力。然而,由于缺乏反映准确本土实体(如人名、组织名和货币)的社会文化任务数据集,低资源语言中的多语言和基于文化的数学推理落后于英语。现有的多语言基准主要通过翻译产生,并且通常保留以英语为中心的实体,这是由于基于人工标注者的本地化成本高昂。此外,自动化本地化工具有限,因此真正本地化的数据集仍然稀缺。为了弥合这一差距,我们引入了一个LLM驱动的数学应用题文化本地化框架,该框架从现有来源中自动构建包含本土名称、组织和货币的数据集。我们发现,在适当的社会文化背景下,翻译后的基准可能会掩盖真实的多语言数学能力。通过广泛的实验,我们还表明,我们的框架有助于减轻以英语为中心的实体偏差,并在跨多种语言引入本土实体时提高鲁棒性。

关键词

引用

@article{arxiv.2508.14913,
  title  = {Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages},
  author = {Israel Abebe Azime and Tadesse Destaw Belay and Dietrich Klakow and Philipp Slusallek and Anshuman Chhabra},
  journal= {arXiv preprint arXiv:2508.14913},
  year   = {2026}
}