大语言模型在经济因果推理中的意识形偏见
人工智能
2026-04-24 v1 计算工程、金融与科学
计算与语言
机器学习
综合经济学
经济学
摘要
大型语言模型 (LLM) 在推理经济因果效应时是否 exhibit 系统性的意识形偏见?随着 LLM 在政策分析和经济报道中的应用日益增多,其中在需要准确因果判断的情境中,这一问题具有直接的实际意义。我们通过扩展 EconCausal 基准,加入意识形争议案例——即干预导向 (pro-government) 和市场导向 (pro-market) 视角预测因果符号相异的情境——来进行系统评估。我们从 top-tier 经济和金融期刊中提炼出 10,490 个因果三元组 (treatment-outcome 对,具有经验证实的因果效应方向),识别出 1,056 个意识形争议实例,并对 20 个最先进的 LLM 在其预测经验证实的因果方向方面的能力进行评估。我们发现,意识形争议项目的难度明显高于非争议项目;而且在 18 个模型中,准确率在经验证实的因果符号与干预导向期望一致时明显高于与市场导向期望一致时。此外,当模型出错时,其错误预测倾向于偏向干预导向,而这种方向性偏差并未被一次性 in-context 提示所消除。这些结果表明,LLM 在意识形争议的经济问题上不仅准确率较低,而且在一个意识形方向上系统性地不可靠,这凸显了在高风险经济和政策情境中需要进行面向因果方向的评估。
引用
@article{arxiv.2604.21334,
title = {Ideological Bias in LLMs' Economic Causal Reasoning},
author = {Donggyu Lee and Hyeok Yun and Jungwon Kim and Junsik Min and Sungwon Park and Sangyoon Park and Jihee Kim},
journal= {arXiv preprint arXiv:2604.21334},
year = {2026}
}