中文

学习路由语言以实现多语言策略优化

计算与语言 2026-05-26 v1

摘要

大语言模型(LLM)是在异构的多语言语料库上训练的,然而现有的策略优化方法通常隐式地将每个训练问题限制为单一响应语言,或者依赖固定的主导语言进行监督。我们提出了语言路由策略优化(LRPO),这是一个在线策略优化框架,将语言视为一个可选择的变量。LRPO为每个训练问题引出多语言展开,并将其相对质量整合到基于偏好的策略更新中,从而在固定的展开预算下增加了训练信号的多样性和信息量。为了在强化学习过程中自适应地确定要探索哪些语言,我们引入了一个可训练的语言路由器,其形式为多臂老虎机,平衡了对未充分利用语言的探索与对信息量更大的语言的利用。大量实验表明,LRPO持续提升了多语言性能,证明自适应语言路由能够实现有效的跨语言知识利用以进行训练。我们在https://github.com/Guochry/LRPO发布了所有资源。

关键词

引用

@article{arxiv.2605.25360,
  title  = {Learning to Route Languages for Multilingual Policy Optimization},
  author = {Geyang Guo and Hiromi Wakaki and Yuki Mitsufuji and Alan Ritter and Wei Xu},
  journal= {arXiv preprint arXiv:2605.25360},
  year   = {2026}
}

备注

Accepted at ICML 2026