FDM-Bench:评估大语言模型在增材制造任务中的综合基准
机器学习
2026-04-16 v1 系统与控制
系统与控制
摘要
熔融沉积建模(FDM)是一种广泛使用的增材制造(AM)技术,因其灵活性和成本效益而受到重视,在医疗保健和航空航天等多个行业有广泛应用。近来的发展使经济型FDM设备得以普及,并鼓励了各类用户的采用。然而,FDM的设计、规划和生产过程需要专门的多学科知识。管理FDM中的复杂参数和解决打印缺陷仍然具有挑战性。这些技术复杂性构成了阻止没有技术背景的个人甚至没有接受过其他领域培训的专业工程师参与AM设计和制造的最关键障碍。大语言模型(LLMs)凭借其在文本和代码处理方面的先进能力,有望应对FDM中的这些挑战。然而,该领域现有的LLM应用研究有限,通常只关注特定用例,而未在多个模型和任务上提供全面评估。为此,我们引入了FDM-Bench,一个旨在评估LLMs在FDM特定任务上表现的基准数据集。FDM-Bench通过包含不同经验水平的用户查询和代表多种异常情况的G-code样本,实现了全面评估。我们在FDM-Bench上评估了两个闭源模型(GPT-4o和Claude 3.5 Sonnet)和两个开源模型(Llama-3.1-70B和Llama-3.1-405B)。一组FDM专家详细评估了模型对用户查询的回应。结果表明,闭源模型在G-code异常检测方面通常优于开源模型,而Llama-3.1-405B在回应用户查询方面表现出轻微优势。这些发现强调了FDM-Bench作为推进LLM在FDM领域研究的基础工具的潜力。
引用
@article{arxiv.2412.09819,
title = {FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks},
author = {Ahmadreza Eslaminia and Adrian Jackson and Beitong Tian and Avi Stern and Hallie Gordon and Rajiv Malhotra and Klara Nahrstedt and Chenhui Shao},
journal= {arXiv preprint arXiv:2412.09819},
year = {2026}
}