中文

评估大型语言模型在交通系统工程中的能力:准确性、一致性与推理行为

人工智能 2024-08-16 v1 计算与语言 机器学习

摘要

本文探讨了最先进的大型语言模型 (LLM) 如 GPT-4、GPT-4o、Claude 3.5 Sonnet、Claude 3 Opus、Gemini 1.5 Pro、Llama 3 和 Llama 3.1 在解决选取的 undergraduate-level 交通工程问题中的能力。我们引入 TransportBench,一个包含交通工程问题的基准数据集,涵盖规划、设计、管理和控制交通系统的广泛主题。该数据集由人类专家使用,用于评估各种商业和开源 LLM 的能力,特别是其在解决交通工程问题方面的准确性、一致性和推理行为。我们的全面分析揭示了每个 LLM 的独特优势和局限性,例如我们的分析显示 Claude 3.5 Sonnet 在解决 TransportBench 问题时表现出惊人的准确性和一些意外不一致的行为。我们的研究标志着利用人工通用智能解决复杂交通挑战的激动人心的第一步。

关键词

引用

@article{arxiv.2408.08302,
  title  = {Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors},
  author = {Usman Syed and Ethan Light and Xingang Guo and Huan Zhang and Lianhui Qin and Yanfeng Ouyang and Bin Hu},
  journal= {arXiv preprint arXiv:2408.08302},
  year   = {2024}
}