中文

揭示假设:探索AI聊天机器人与人类测试者的决策

软件工程 2024-06-18 v1

摘要

大语言模型(LLM)和聊天机器人的集成,为软件测试中的决策引入了新的挑战和机遇。决策依赖于多种信息,包括代码、需求规格说明以及其他通常不明确或仅存在于开发者脑海中的软件工件。为了填补不明确信息留下的空白,我们常常依赖假设、直觉或以往经验来做决策。本文探讨了基于LLM的聊天机器人(如Bard、Copilot和ChatGPT)在支持软件测试者进行测试决策(例如有效确定测试用例优先级)方面的潜力。我们研究了在穷尽执行测试用例通常不切实际的禁止性测试场景中,基于LLM的聊天机器人和人类测试者是否共享相似的“假设”或直觉。一项针对127名测试者的初步调查结果显示,他们倾向于多样化的测试场景,绝大多数(96%)偏好不相似的测试集。有趣的是,四个聊天机器人中有两个反映了这种偏好,与人类直觉一致,而另外两个则选择了相似的测试场景,仅有3.9%的测试者选择。我们的初步见解表明,在增强测试者与聊天机器人之间协作动态的背景下,存在一条有前景的途径。

关键词

引用

@article{arxiv.2406.11339,
  title  = {Unveiling Assumptions: Exploring the Decisions of AI Chatbots and Human Testers},
  author = {Francisco Gomes de Oliveira Neto},
  journal= {arXiv preprint arXiv:2406.11339},
  year   = {2024}
}

备注

Published at the 1st ACM International Conference on AI-Powered Software (AIWare 2024)