中文

超越直观:在金融情境中评估 LLM 的发散性与收敛性思维

人工智能 2025-07-25 v1

摘要

大多数针对 LLM 的推理基准测试侧重于事实准确性或逐步逻辑。在金融领域,专业人士不仅需要收敛于最优决策,还需在不确定性下生成创造性且合情合理的未来情景。我们提出 ConDiFi,一个用于评估 LLM 在金融任务中发散性与收敛性思维的基准测试。ConDiFi 包含 607 个宏观金融提示,用于发散推理,以及 990 个多跳对抗性选择题,用于收敛推理。使用该基准测试,我们评估了 14 个领先模型,发现显著差异。尽管语言流畅度高,GPT-4o 在新颖性和可操作性方面表现不佳。相比之下,DeepSeek-R1 和 Cohere Command R+ 等模型在生成适用于投资决策的可操作见解方面排名靠前。ConDiFi 提供了一种全新视角,用于评估 LLM 在金融领域安全和战略部署中所必需的推理能力。

关键词

引用

@article{arxiv.2507.18368,
  title  = {Reasoning Beyond the Obvious: Evaluating Divergent and Convergent Thinking in LLMs for Financial Scenarios},
  author = {Zhuang Qiang Bok and Watson Wei Khong Chua},
  journal= {arXiv preprint arXiv:2507.18368},
  year   = {2025}
}

备注

Accepted by Agentic & GenAI Evaluation KDD2025: KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models https://kdd-eval-workshop.github.io/genai-evaluation-kdd2025/