面向步骤化领域知识驱动的推理优化与反思改进
人工智能
2025-04-15 v1 计算与语言
摘要
最近,针对链式思维(CoT)的逐步监督在寻求逻辑推理任务(如编程和数学)方面发挥了作用,借助蒙特卡洛树搜索(MCTS)。然而,其对需要领域特定专业知识的任务的贡献仍未得到探索。针对这一兴趣,我们识别了vanilla MCTS在该语境下的若干潜在挑战,并提出了步骤化领域知识驱动推理优化框架,采用MCTS算法为需要基本理解、推理和专业知识的问题开发逐层监督。此外,我们还引入了针对反思路径的偏好优化,通过迭代学习从更佳视角对推理思想进行自我反思。我们进行了大量实验以评估这些方法的优势。实证结果表明,这些方法在 various 法律领域问题上均有效。我们还报告了一系列有价值的发现,希望能鼓舞人们对领域特定大语言模型(LLM)和MCTS的研究热情。
引用
@article{arxiv.2504.09058,
title = {Towards Stepwise Domain Knowledge-Driven Reasoning Optimization and Reflection Improvement},
author = {Chengyuan Liu and Shihang Wang and Lizhi Qing and Kaisong Song and Junjie Cao and Jun Lin and Ji Zhang and Ang Li and Kun Kuang and Fei Wu},
journal= {arXiv preprint arXiv:2504.09058},
year = {2025}
}
备注
Under review