中文

EEE-Bench:一个全面的多模态电气与电子工程基准测试

计算机视觉与模式识别 2025-02-28 v2

摘要

关于大型语言模型(LLMs)和大型多模态模型(LMMs)的最新研究表明,它们在科学和数学等多个领域展现出令人瞩目的能力。然而,它们在更具挑战性和现实世界相关的场景(如工程领域)中的能力尚未得到系统性研究。为了弥补这一差距,我们提出了EEE-Bench,一个旨在评估LMMs解决实际工程任务能力的多模态基准测试,以电气与电子工程(EEE)作为测试平台。我们的基准测试包含2860个精心策划的问题,涵盖10个关键子领域,如模拟电路、控制系统等。与其他领域的基准测试相比,工程问题本质上1)更具视觉复杂性和多样性,2)解决方案的确定性更低。这些问题的成功解决通常需要比平时更严格地整合视觉和文本信息,因为模型需要理解抽象电路和系统图等复杂图像,同时遵循专业指令,这使它们成为LMM评估的优秀候选。除了EEE-Bench,我们对17个广泛使用的开源和闭源LLMs和LMMs进行了广泛的定量评估和细致分析。我们的结果表明,当前基础模型在EEE领域存在显著不足,平均性能在19.48%到46.78%之间。最后,我们揭示并探讨了LMMs中一个关键缺陷,我们称之为"懒惰":在推理技术图像问题时倾向于走捷径,依赖文本而忽视视觉语境。总之,我们相信EEE-Bench不仅揭示了LMMs的一些值得关注的局限性,还为推进其在实际工程任务中的应用研究提供了宝贵的资源,推动其处理复杂现实世界场景能力的未来改进。

关键词

引用

@article{arxiv.2411.01492,
  title  = {EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark},
  author = {Ming Li and Jike Zhong and Tianle Chen and Yuxiang Lai and Konstantinos Psounis},
  journal= {arXiv preprint arXiv:2411.01492},
  year   = {2025}
}

备注

Accepted to CVPR 2025