中文

文化迁移中的困境:LLM在跨文化数学情境中的挑战

人工智能 2026-04-09 v2 机器学习

摘要

我们展示了大型语言模型(LLM)的数学推理具有文化敏感性:在测试来自 Anthropic、OpenAI、Google、Meta、DeepSeek、Mistral 和 Microsoft 的 14 个模型后,通过六个文化适应变体的 GSM8K 基准测试,我们发现当数学问题嵌入不熟悉的文化情境中时(即使底层数学逻辑不变),准确率下降范围从 Claude 3.5 Sonnet 的 0.3% 到 LLaMA 3.1-8B 的 5.9%。这些统计显著的性能下降(p < 0.01,通过 McNemar 检验确认)揭示了 LLM 的数学推理并非文化中性。为此,我们为 Haiti、Moldova、Pakistan、Solomon Islands、Somalia 和 Suriname 系统性地替换了 1,198 题 GSM8K 问题中的文化实体(姓名、食物、地点等),同时保留所有数学运算和数值。我们对 18,887 个实例的定性误差分析显示,文化适应影响更广泛的推理模式,其中数学推理错误占 54.7%,计算错误占 34.5%。有趣的是,文化熟悉度可以提升性能:Mistral Saba 在 Pakistan 适应问题上超越了一些更大的模型,这是由于其在中东和南亚训练数据中的曝光所致。这一研究强调了需要更多样化的训练数据,以确保 LLM 在全球语境下实现稳健的性能。

关键词

引用

@article{arxiv.2503.18018,
  title  = {Lost in Cultural Translation: Do LLMs Struggle with Math Across Cultural Contexts?},
  author = {Aabid Karim and Abdul Karim and Bhoomika Lohana and Matt Keon and Jaswinder Singh and Abdul Sattar},
  journal= {arXiv preprint arXiv:2503.18018},
  year   = {2026}
}