ChatGPT 支持任务工程中问题构建任务能力的实证探索及其性能变异性记录
软件工程
2025-02-07 v1 人工智能
计算与语言
摘要
随着生成式人工智能(AI)的可用性以及对系统之系统视角的需求,系统工程(SE)正在发展,这在美国国防部任务工程(ME)的范畴内被形式化。构建 ME 问题具有挑战性,因为它们是一种开放式练习,涉及将定义不清的问题转化为适合工程开发的明确定义的问题。人工智能能在多大程度上协助问题构建目标仍有待观察。为此,本文探讨了多用途大语言模型(LLM)在支持 ME 问题构建任务中的质量和一致性,特别关注利益相关者识别。我们确定了一个相关的参考问题,即 NASA 太空任务设计挑战,并记录了 ChatGPT-3.5 执行利益相关者识别任务的能力。我们执行了多次并行尝试,并定性评估了 LLM 的输出,重点关注其质量和变异性。我们的发现描绘了一幅微妙的图景。我们发现,LLM 在识别以人为中心的利益相关者方面表现良好,但在识别外部系统和环境因素方面表现不佳,尽管我们明确努力考虑这些因素。此外,LLM 难以保持所需的抽象水平,并表现出产生不适合问题构建的特定解决方案输出的倾向。更重要的是,我们记录了并行线程之间的巨大变异性,强调应谨慎使用 LLM 输出,理想情况下应采用随机视角看待其能力。总体而言,我们的发现表明,虽然 ChatGPT 可以减少一些专家的工作量,但其缺乏一致性和领域理解可能会限制其在问题构建任务中的可靠性。
引用
@article{arxiv.2502.03511,
title = {An Empirical Exploration of ChatGPT's Ability to Support Problem Formulation Tasks for Mission Engineering and a Documentation of its Performance Variability},
author = {Max Ofsa and Taylan G. Topcu},
journal= {arXiv preprint arXiv:2502.03511},
year = {2025}
}
备注
10 pages, 3 figures, submitted to Conference on Systems Engineering Research (CSER)