中文

使用 RLVR 研究韩语单词链游戏:通过课程学习缓解奖励冲突

机器学习 2025-10-16 v2 计算与语言

摘要

基于可验证奖励的强化学习 (RLVR) 是一种有前景的训练大型语言模型 (LLM) 以获得更强推理能力的方法。这也已被应用于各种逻辑谜题。在本工作中,我们使用 RLVR 研究韩语单词链游戏。我们表明,基于规则的奖励可以自然发生冲突,并通过实验表明课程学习方案可缓解这些冲突。我们的发现激励对多语言环境中谜题任务的进一步研究。

关键词

引用

@article{arxiv.2510.03394,
  title  = {Studying the Korean Word-Chain Game with RLVR: Mitigating Reward Conflicts via Curriculum Learning},
  author = {Donghwan Rho},
  journal= {arXiv preprint arXiv:2510.03394},
  year   = {2025}
}

备注

10 pages