中文

利用人类-AI 反馈强化学习增强大语言模型的物理问题求解能力

机器学习 2024-12-11 v1 人工智能

摘要

大语言模型(LLM)在文本任务中已展现出强大能力,但在物理问题所需的复杂推理方面存在困难,尤其是在高级算术和概念理解方面。虽然已有部分研究探索了利用提示工程和检索增强生成(RAG)等技术提升 LLM 在物理教育中的表现,但在解决其物理推理局限性方面的努力仍不够充分。本文提出了一种利用人类与人工智能反馈强化学习(RLHAIF)提升 LLM 在物理问题上表现的新方法。我们评估了多种强化学习方法,包括 Proximal Policy Optimization(PPO)、Direct Preference Optimization(DPO)和 Remax 优化。这些方法被用于在不同设置下研究 RL 策略在 PhyQA 数据集上的性能,该数据集包含来自高中教科书的具有挑战性的物理问题。我们的 RLHAIF 模型在 LLaMA2 和 Mistral 等主流 LLM 上进行了测试,取得了优异结果,其中 MISTRAL-PPO 模型表现最为突出,在推理和准确率方面均有显著提升。该模型取得了 58.67 的 METEOR 分数和 0.74 的 Reasoning 分数,成为该领域未来物理推理研究的优秀范例。

关键词

引用

@article{arxiv.2412.06827,
  title  = {Enhancing LLMs for Physics Problem-Solving using Reinforcement Learning with Human-AI Feedback},
  author = {Avinash Anand and Kritarth Prasad and Chhavi Kirtani and Ashwin R Nair and Mohit Gupta and Saloni Garg and Anurag Gautam and Snehal Buldeo and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2412.06827},
  year   = {2024}
}