DesignQA:评估大语言模型对工程文档理解能力的多模态基准
人工智能
2024-08-26 v2 计算与语言
摘要
本研究引入了 DesignQA,这是一个新颖的基准,旨在评估多模态大语言模型(MLLMs)理解和应用技术文档中工程要求的能力。DesignQA 以现实世界的工程挑战为重点,独特地结合了多模态数据,包括源自 Formula SAE 学生竞赛的文本设计要求、CAD 图像和工程图纸。与许多现有的 MLLM 基准不同,DesignQA 包含基于文档的视觉问答,其中输入图像和输入文档来自不同来源。该基准具有自动评估指标,并根据工程师按需求进行设计时执行的任务划分为几个部分:规则理解、规则合规和规则提取。我们针对该基准评估了(截至撰写时)最先进的模型,如 GPT-4o、GPT-4、Claude-Opus、Gemini-1.0 和 LLaVA-1.5,我们的研究揭示了 MLLM 在解释复杂工程文档能力方面存在的差距。受测的 MLLM 虽然前景广阔,但难以从 Formula SAE 文档中可靠地检索相关规则,在识别 CAD 图像中的技术组件时面临挑战,并且在分析工程图纸时遇到困难。这些发现强调了对能够更好地处理技术文档设计中特有的多方面问题的多模态模型的需求。该基准为未来 AI 支持的工程设计流程的进步奠定了基础。DesignQA 已公开发布于:https://github.com/anniedoris/design_qa/。
引用
@article{arxiv.2404.07917,
title = {DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation},
author = {Anna C. Doris and Daniele Grandi and Ryan Tomich and Md Ferdous Alam and Mohammadmehdi Ataei and Hyunmin Cheong and Faez Ahmed},
journal= {arXiv preprint arXiv:2404.07917},
year = {2024}
}