非英语语言中的推理成本:以日语为例的研究
计算与语言
2026-07-11 v1 人工智能
机器学习
摘要
推理语言模型(RLMs)在用英语推理时能达到最强性能,因为针对推理的训练数据在英语中最为丰富。然而,推理轨迹是模型可解释性和安全性的线索,并且对模型用户和模型开发者来说在实践中都很有用。因此,能够开发一个用用户选择的语言进行推理,同时保持强大推理性能的模型是可取的。为此,我们研究了训练一个用日语推理的模型的可行性。我们开发了 Qwen-3-Swallow-8B 的日语推理变体,该模型是一个从 Qwen-3-8B 持续预训练的日语大语言模型,并使用 GRPO 进行训练,在编程、数学和科学基准上进行了评估。研究表明,通过使用 GRPO 训练一个日语持续预训练模型,推理语言控制是可行的。然而,在几个基准上,其性能最多与强大的英语推理基线相当。我们还在日本文化基准上评估了训练后的模型,观察到模型的性能低于基线模型,这表明用日语推理并不能立即免费提高文化相关任务上的性能。
引用
@article{arxiv.2607.10114,
title = {Cost of Reasoning in non-English Languages: A Case Study on Japanese},
author = {Yuu Jinnai},
journal= {arXiv preprint arXiv:2607.10114},
year = {2026}
}