金融情感分析中的推理与过度思考:评估大型语言模型的表现
计算与语言
2025-06-06 v1 人工智能
摘要
我们探讨了大型语言模型(LLM),包括基于推理和非推理模型,在执行零样态金融情感分析方面的有效性。使用由领域专家标注的Financial PhraseBank数据集,我们评估了各种LLM和提示策略在金融语境下是否与人类标注的情感一致。我们比较了三个专有LLM(GPT-4o、GPT-4.1、o3-mini)在不同提示范式下的表现,这些范式模拟了System 1(快速直觉)或System 2(慢而深思)的思维方式,并将其与两个较小模型(FinBERT-Prosus、FinBERT-Tone)在金融情感分析上微调的模型进行基准测试。我们的发现表明,推理——无论是通过提示还是内在模型设计——并未提升该任务的性能。令人惊讶的是,最准确且与人类一致的模型和方法组合为GPT-4o,且无需任何链式思维(CoT)提示。我们进一步探讨了语言复杂性和标注一致性水平如何影响性能,发现推理可能导致过度思考,从而导致次优预测。这表明,在金融情感分类任务中,快速而直觉的“System 1”式思维比模拟由推理模型或CoT提示实现的“System 2”式 slower、深思熟虑的推理更贴近人类判断。我们的结果挑战了“更多推理总是导致更好LLM决策”的默认假设,尤其是在高风险金融应用中。
引用
@article{arxiv.2506.04574,
title = {Reasoning or Overthinking: Evaluating Large Language Models on Financial Sentiment Analysis},
author = {Dimitris Vamvourellis and Dhagash Mehta},
journal= {arXiv preprint arXiv:2506.04574},
year = {2025}
}