像经济学家一样推理:在经济问题上的后训练诱导 LLM 的策略泛化
人工智能
2025-06-03 v1 计算与语言
计算机科学与博弈论
多智能体系统
摘要
由于复杂的奖励建模、动态的智能体交互和苛刻的泛化要求,直接为多智能体系统 (MAS) 训练大语言模型 (LLM) 仍然具有挑战性。本文探讨了后训练技术,特别是监督微调 (SFT) 和带可验证奖励的强化学习 (RLVR),能否有效地到多智能体场景。我们以经济推理作为试验平台,利用其在数学和博弈论方面的坚实基础、对结构化分析推理的要求,以及与市场设计、资源配置和政策分析等现实世界应用的相关性。我们引入了 (easoning like an omist),这是一个 7B 参数的开源 LLM,在包含 2,100 个高质量经济推理问题的人工精选数据集上进行了后训练。对经济推理基准和多智能体博弈的综合评估表明,在结构化推理和经济理性方面有显著改善。这些结果突显了领域对齐后训练在增强推理和智能体对齐方面的潜力,并揭示了 SFT 和 RL 在塑造模型行为中的作用。代码可在 https://github.com/MasterZhou1/Recon 获取。
引用
@article{arxiv.2506.00577,
title = {Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs},
author = {Yufa Zhou and Shaobo Wang and Xingyu Dong and Xiangqi Jin and Yifang Chen and Yue Min and Kexin Yang and Xingzhang Ren and Dayiheng Liu and Linfeng Zhang},
journal= {arXiv preprint arXiv:2506.00577},
year = {2025}
}