中文

基于 RLHF 的 Step Signals 提升归谈推理

机器学习 2024-10-25 v2 人工智能

摘要

逻辑推理是大型语言模型(LLM)的关键任务,使其能够解决复杂问题。在推理任务中,多步骤推理尤具挑战性。基于形式逻辑理论,我们开发了一种自动方法——Multi-step Deduction(MuseD)——用于归谈推理数据生成。MuseD 使我们能够创建用于多步骤推理的训练和测试数据集。我们的生成方法允许控制生成指令的复杂度,从而便于在不同难度水平上进行模型的训练和评估。通过 RLHF 训练,我们的训练数据在逻辑能力方面显著提升了 both in-domain 和 out-of-domain 推理任务。此外,我们对 various models 的多步骤推理能力进行了测试。

关键词

引用

@article{arxiv.2410.09528,
  title  = {Boosting Deductive Reasoning with Step Signals In RLHF},
  author = {Jialian Li and Yipin Zhang and Wei Shen and Yuzi Yan and Jian Xie and Dong Yan},
  journal= {arXiv preprint arXiv:2410.09528},
  year   = {2024}
}