中文

软件评论中的 ChatGPT 正确性检测

软件工程 2024-03-26 v1 人工智能 机器学习

摘要

我们对 135 名软件工程师实践者进行调查,以了解他们如何使用类似 ChatGPT 这样的生成式 AI 聊天机器人来完成软件工程任务。我们发现他们希望利用 ChatGPT 进行软件库选择,但常常担心 ChatGPT 回答的真实性。我们开发了一套技术方法并构建了一个名为 CID(ChatGPT Incorrectness Detector)的工具,用于自动检测 ChatGPT 回答中的错误。CID 基于通过对 ChatGPT 进行迭代提问来实现,其中通过提出与原问题在语境上相似但在文本上有所差异的问题(使用一种利用文本的变形关系的方法)。CID 的基本原理是:对于给定问题,若其回答与其他回答(在问题的多个不同表述下)不同,则该回答很可能是错误的。在图书馆选择的基准研究中,我们展示了 CID 能以 0.74-0.75 的 F1 分数检测来自 ChatGPT 的错误回答。

关键词

引用

@article{arxiv.2403.16347,
  title  = {ChatGPT Incorrectness Detection in Software Reviews},
  author = {Minaoar Hossain Tanzil and Junaed Younus Khan and Gias Uddin},
  journal= {arXiv preprint arXiv:2403.16347},
  year   = {2024}
}