大型语言模型设计综合可靠性:方差、提示敏感性与方法脚手架的实证研究
软件工程
2026-04-07 v1
摘要
大型语言模型(LLM)日益用于自动化软件工程任务,包括从自然语言描述生成UML类图。虽然已有研究表明LLM可以生成语法有效的图表,但仅凭语法正确性不足以保证有意义的设计。本研究探讨了LLM能否超越图表翻译,执行设计综合,以及它们在变异下如何可靠地维持设计导向的推理。我们引入了基于偏好的少样本提示方法,以偏向满足面向对象的原则和模式一致结构的设计。两种设计意图基准,每个基准包含三个领域专属、改写后的提示和10次重复运行,用于评估三个LLM(ChatGPT 4o-mini、Claude 3.5 Sonnet、Gemini 2.5 Flash),采用三种建模策略:标准提示、规则注入提示和偏好式提示,总计540次实验(即2x3x10x3x3)。结果表明,尽管偏好式对齐改善了对设计意图的遵循,但未消除非决定性;模型层面的行为对设计可靠性影响显著。这些发现表明,实现可靠的LLM辅助软件设计不仅需要有效的提示方法,也需要仔细考虑模型行为和鲁棒性。
引用
@article{arxiv.2604.00851,
title = {Reliability of Large Language Models for Design Synthesis: An Empirical Study of Variance, Prompt Sensitivity, and Method Scaffolding},
author = {Rabia Iftikhar and Andreas Rausch},
journal= {arXiv preprint arXiv:2604.00851},
year = {2026}
}