大型语言模型在控制工程中的能力:针对 GPT-4、Claude 3 Opus 和 Gemini 1.0 Ultra 的基准研究
最优化与控制
2024-04-05 v1 人工智能
机器学习
摘要
本文探讨了如 GPT-4、Claude 3 Opus 和 Gemini 1.0 Ultra 等最先进大型语言模型(LLM)在解决 undergraduate 水平控制问题方面的能力。控制工程提供了一种有趣的案例研究,由于其数学理论与工程设计的结合。我们引入 ControlBench,一个针对经典控制设计 breadth、depth 和 complexity 量身定制的基准数据集。我们使用该数据集来研究和评估这些 LLM 在控制工程背景下的 problem-solving 能力。我们呈现由人类专家小组进行的评估,提供关于 LLM 在控制工程中 accuracy、reasoning 和 explanatory 能力的见解。我们的分析揭示了每个 LLM 在经典控制背景下的优势与局限性,我们的结果表明 Claude 3 Opus 已成为解决 undergraduate 控制问题的 state-of-the-art LLM。我们的研究为更广泛地运用人工通用智能在控制工程中奠定了初始步骤。
关键词
引用
@article{arxiv.2404.03647,
title = {Capabilities of Large Language Models in Control Engineering: A Benchmark Study on GPT-4, Claude 3 Opus, and Gemini 1.0 Ultra},
author = {Darioush Kevian and Usman Syed and Xingang Guo and Aaron Havens and Geir Dullerud and Peter Seiler and Lianhui Qin and Bin Hu},
journal= {arXiv preprint arXiv:2404.03647},
year = {2024}
}