教导大型语言模型进行数学思考:关于通过优化进行决策的批判性研究
摘要
本文调查了大型语言模型(LLM)在使用数学编程解决 decision-making 问题方面的能力。我们首先进行系统性综述和 meta-analysis of 最近的文献,以评估 LLM 如何理解、结构和解决 optimization 问题 across 多个领域。该分析由关注 learning approaches、dataset designs、evaluation metrics 和 prompting strategies 的 critical review questions 指导。我们的 systematic evidence 由针对性实验补充,这些实验旨在评估最新 LLM 在自动为计算机网络中的问题生成 optimization models 的 performance。使用新构建的数据集,我们应用了 three prompting strategies: Act-as-expert、chain-of-thought 和 self-consistency,并根据 optimality gap、token-level F1 score 和 compilation accuracy 评估所获输出。结果表明,LLM 在解析自然语言和表示符号 formulation 方面取得了有希望的进展,但也揭示了 accuracy、scalability 和 interpretability 中的 key 限制。这些 empirical gaps 激励了 several 未来 research directions,包括 structured datasets、domain-specific fine-tuning、hybrid neuro-symbolic approaches、modular multi-agent architectures 和 dynamic retrieval via chain-of-RAGs。这篇论文为 advancing LLM capabilities in mathematical programming 提供了结构化 roadmap。
引用
@article{arxiv.2508.18091,
title = {Teaching LLMs to Think Mathematically: A Critical Study of Decision-Making via Optimization},
author = {Mohammad J. Abdel-Rahman and Yasmeen Alslman and Dania Refai and Amro Saleh and Malik A. Abu Loha and Mohammad Yahya Hamed},
journal= {arXiv preprint arXiv:2508.18091},
year = {2025}
}