BPP-Search:增强数学建模问题解答中的树状思考推理
人工智能
2025-05-27 v4 计算与语言
摘要
大语言模型展现出先进的推理能力,具有将自然语言问题转化为数学模型的潜力。然而,现有的面向操作研究领域的开源数据集缺乏对建模过程的详细标注(如变量定义),仅关注目标值,这限制了强化学习的应用。为此,我们发布了 StructuredOR 数据集,标注了完整的建模过程。我们进一步提出 BPP-Search 方法,通过将强化学习集成到树状思考结构中,利用 Beam search、Process reward model 和配对偏好算法。该方法高效地探索树结构,避免穷举搜索,同时提高准确率。在 StructuredOR、NL4OPT 和 MAMO-ComplexLP 数据集上进行大量实验表明,BPP-Search 在各项指标上均显著优于最先进的方法。在树状推理任务中,BPP-Search 在准确率和效率方面表现卓越,能够更快地检索到正确解答。StructuredOR 数据集已在 Huggingface 上发布 https://huggingface.co/datasets/LLM4OR/StructuredOR,GitHub 地址为 https://github.com/LLM4OR/StructuredOR。
引用
@article{arxiv.2411.17404,
title = {BPP-Search: Enhancing Tree of Thought Reasoning for Mathematical Modeling Problem Solving},
author = {Teng Wang and Wing-Yin Yu and Zhenqi He and Zehua Liu and Hailei Gong and Han Wu and Xiongwei Han and Wei Shi and Ruifeng She and Fangzhou Zhu and Tao Zhong},
journal= {arXiv preprint arXiv:2411.17404},
year = {2025}
}