中文

超越统计相似性:重新思考工程设计中深度生成模型的指标

机器学习 2025-11-18 v5

摘要

深度生成模型,如变分自编码器(VAE)、生成对抗网络(GAN)、扩散模型和 Transformer,在图像和语音合成、自然语言处理以及药物发现等各种应用中展现出了巨大潜力。然而,当应用于工程设计问题时,评估这些模型的性能可能具有挑战性,因为基于似然的传统统计指标可能无法完全捕捉工程应用的需求。本文兼作工程设计中深度生成模型(DGM)评估指标的综述与实用指南。我们首先总结了基于机器学习理论并被广泛接受的深度生成模型“经典”评估指标。然后,通过案例研究,我们强调了为什么这些指标很少能很好地转化为设计问题,但由于缺乏成熟的替代方案而仍被频繁使用。接下来,我们精选了一组在各个研究社区中提出的特定于设计的指标,可用于评估深度生成模型。这些指标侧重于设计和工程中的独特要求,如约束满足、功能性能、新颖性和条件性。在整个讨论过程中,我们将这些指标应用于在易于可视化的二维示例问题上训练的模型。最后,我们在自行车车架设计问题和结构拓扑生成问题上评估了四种深度生成模型。具体而言,我们展示了如何使用所提出的指标来量化性能目标达成度、设计新颖性和几何约束。我们在 https://decode.mit.edu/projects/metrics/ 上公开发布了本文所使用的数据集、模型和指标的代码。

关键词

引用

@article{arxiv.2302.02913,
  title  = {Beyond Statistical Similarity: Rethinking Metrics for Deep Generative Models in Engineering Design},
  author = {Lyle Regenwetter and Akash Srivastava and Dan Gutfreund and Faez Ahmed},
  journal= {arXiv preprint arXiv:2302.02913},
  year   = {2025}
}