中文

$(N,K)$-Puzzle:一种用于基准测试生成式语言模型强化学习算法的高性价比测试平台

机器学习 2024-03-13 v1 人工智能 计算与语言

摘要

近年来,强化学习(RL)算法的进展旨在提升大规模语言模型的性能。然而,目前明显缺乏一种具有成本效益且标准化的测试平台,专门用于评估和比较这些算法。为填补这一空白,我们提出了 24-Puzzle 的泛化版本:(N,K)(N,K)-Puzzle,该任务挑战语言模型利用 NN 个整数达到目标值 KK。我们评估了既定 RL 算法(如近端策略优化 PPO)以及新颖方法(如恒等策略优化 IPO 和直接策略优化 DPO)的有效性。

关键词

引用

@article{arxiv.2403.07191,
  title  = {$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model},
  author = {Yufeng Zhang and Liyu Chen and Boyi Liu and Yingxiang Yang and Qiwen Cui and Yunzhe Tao and Hongxia Yang},
  journal= {arXiv preprint arXiv:2403.07191},
  year   = {2024}
}

备注

8 pages