中文

将人工智能与人类专家知识集成:对ChatGPT在生成变形关系方面能力的深入分析

软件工程 2025-03-31 v1 人工智能

摘要

背景:本文对使用 OpenAI 开发的 GPT 模型生成和评估变形关系(MRs)进行深入考察,特别关注 GPT-4 在软件测试环境中的能力。目标:旨在检验 GPT-3.5 和 GPT-4 为特定系统(SUT)生成的 MRs 的质量,并引入并应用一套改进的评估标准,以适用于多样化的 SUT。方法:初始阶段使用先前研究中的标准评估 GPT-3.5 和 GPT-4 生成的 MRs,随后在由 GPT-4 为九个不同 SUT(从简单程序到集成 AI/ML 组件的复杂系统)生成的 MRs 上应用改进的评估框架。使用自构建的 GPT 评估器以及人类评估器对 MRs 进行评估,实现自动化与人类评估方法的直接比较。结果:研究发现 GPT-4 在生成准确且有用的 MRs 方面优于 GPT-3.5。凭借先进的评估标准,GPT-4 在广泛的 SUT 上 demonstrate 出显著的能力,包括集成 AI/ML 组件的复杂系统。结论:GPT-4 在生成适用于 various applications 的 MRs 方面展现出先进的能力。这项研究强调了 AI 在软件测试中的潜在发展,尤其是在 MRs 的生成和评估方面,并指向人类与 AI 技能在该领域的互补性。

关键词

引用

@article{arxiv.2503.22141,
  title  = {Integrating Artificial Intelligence with Human Expertise: An In-depth Analysis of ChatGPT's Capabilities in Generating Metamorphic Relations},
  author = {Yifan Zhang and Dave Towey and Matthew Pike and Quang-Hung Luu and Huai Liu and Tsong Yueh Chen},
  journal= {arXiv preprint arXiv:2503.22141},
  year   = {2025}
}

备注

Submitted to Information and Software Technology