LLM 能否帮助提升战略决策中的类比推理?来自人类与 GPT-4 的实验证据
人工智能
2025-05-02 v1 人机交互
摘要
本研究探讨大型语言模型,特别是 GPT4,能否在战略决策情境中匹敌人类的类比推理能力。通过采用涉及源到目标匹配的新型实验设计,我们发现 GPT4 通过检索所有看似合理的类比实现了高召回率,但精确率较低,经常基于表面相似性应用错误的类比。相比之下,人类参与者表现出高精确率但低召回率,选择的类比更少但具有更强的因果一致性。这些发现通过将匹配(类比推理的评估阶段)识别为一个需要超越简单检索的准确因果映射的独特步骤,从而推进了理论。虽然当前的 LLM 擅长生成候选类比,但人类在识别跨领域的深层结构相似性方面保持比较优势。错误分析表明,AI 错误源于表面匹配,而人类错误源于对因果结构的误解。综上所述,结果表明在 AI 辅助的组织决策中存在生产性的劳动分工:LLM 可作为广泛的类比生成器,而人类则作为关键的评估者,将最适合上下文的类比应用于战略问题。
引用
@article{arxiv.2505.00603,
title = {Can LLMs Help Improve Analogical Reasoning For Strategic Decisions? Experimental Evidence from Humans and GPT-4},
author = {Phanish Puranam and Prothit Sen and Maciej Workiewicz},
journal= {arXiv preprint arXiv:2505.00603},
year = {2025}
}