大型语言模型能进行分析推理吗?
计算与语言
2024-03-08 v1 人工智能
摘要
本文探讨了具备体育领域分析推理能力的前沿大型语言模型。我们的分析推理体现为让大型语言模型统计 NBA 和 NFL 比赛中每节各队的得分。我们的主要发现有两方面。首先,在我们使用的所有模型中,GPT-4 效果最为突出,其次是 Claude-2.1,而 GPT-3.5、Gemini-Pro 和 Llama-2-70b 则落后。具体而言,我们比较了三种不同的提示技术和一种分治法,发现后者最为有效。我们的分治法将逐次进攻数据分解为更小、更易于管理的片段,分别解决每个片段,然后将结果汇总。除了分治法,我们还探索了思维链(CoT)策略,该策略显著改善了某些模型(尤其是 GPT-4 和 Claude-2.1)的结果,其准确率大幅提升。然而,CoT 策略对其他模型(如 GPT-3.5 和 Gemini-Pro)的性能影响微乎其微,甚至产生负面影响。其次,令我们惊讶的是,我们观察到大多数模型(包括 GPT-4)难以准确统计 NBA 各节的总得分,尽管它们在统计 NFL 各节得分方面表现强劲。这促使我们通过大量实验进一步调查影响分析推理任务复杂性的因素,得出结论:任务复杂性取决于上下文长度、信息密度以及相关信息的存在与否。我们的研究为理解分析推理任务的复杂性以及未来大型语言模型的开发方向提供了宝贵见解。
引用
@article{arxiv.2403.04031,
title = {Can Large Language Models do Analytical Reasoning?},
author = {Yebowen Hu and Kaiqiang Song and Sangwoo Cho and Xiaoyang Wang and Hassan Foroosh and Dong Yu and Fei Liu},
journal= {arXiv preprint arXiv:2403.04031},
year = {2024}
}