BikeBench: 用于有目标和约束的生成模型的自行车设计基准
计算工程、金融与科学
2025-10-28 v2 人工智能
机器学习
摘要
我们介绍了 BikeBench,这是一个用于评估生成模型在具有多个现实目标和约束问题上的能力的工程设计基准。随着生成式 AI 的范围不断扩大,评估其理解物理定律、人类指南和硬约束的能力变得越来越重要。工程产品设计恰好处于这些困难任务的交汇处,为 AI 能力提供了新的挑战。BikeBench 评估 AI 模型在生成符合特定性能目标和约束条件的自行车设计方面的能力。为此,BikeBench 对various human-centered 和多物理性能特征进行量化,如空气动力学、人体工程学、结构力学、人类评估可用性以及与主观文本或图像提示的相似性。支持该基准的包括多个仿真结果数据集、10,000 份人类评估自行车评估的数据集,以及 160 万份具有参数、CAD/XML、SVG 和 PNG 表示的合成生成设计数据集。BikeBench 独特地配置为对tabular 生成模型、大型语言模型 (LLM)、设计优化和混合算法进行side-by-side 评估。我们的实验表明,LLM 和tabular 生成模型在设计质量、约束满足和相似性评分方面不足以媲美混合 GenAI+优化算法,这表明仍有很大的改进空间。我们希望 BikeBench——这是第一个如此独特的基准——能帮助推动生成式 AI 在受限多目标工程设计问题上的进展。我们在 https://github.com/Lyleregenwetter/BikeBench 提供代码、数据、交互式排行榜和其他资源。
引用
@article{arxiv.2508.00830,
title = {BikeBench: A Bicycle Design Benchmark for Generative Models with Objectives and Constraints},
author = {Lyle Regenwetter and Yazan Abu Obaideh and Fabien Chiotti and Ioanna Lykourentzou and Faez Ahmed},
journal= {arXiv preprint arXiv:2508.00830},
year = {2025}
}