软件评论中的 ChatGPT 正确性检测
软件工程
2024-03-26 v1 人工智能
机器学习
摘要
我们对 135 名软件工程师实践者进行调查,以了解他们如何使用类似 ChatGPT 这样的生成式 AI 聊天机器人来完成软件工程任务。我们发现他们希望利用 ChatGPT 进行软件库选择,但常常担心 ChatGPT 回答的真实性。我们开发了一套技术方法并构建了一个名为 CID(ChatGPT Incorrectness Detector)的工具,用于自动检测 ChatGPT 回答中的错误。CID 基于通过对 ChatGPT 进行迭代提问来实现,其中通过提出与原问题在语境上相似但在文本上有所差异的问题(使用一种利用文本的变形关系的方法)。CID 的基本原理是:对于给定问题,若其回答与其他回答(在问题的多个不同表述下)不同,则该回答很可能是错误的。在图书馆选择的基准研究中,我们展示了 CID 能以 0.74-0.75 的 F1 分数检测来自 ChatGPT 的错误回答。
引用
@article{arxiv.2403.16347,
title = {ChatGPT Incorrectness Detection in Software Reviews},
author = {Minaoar Hossain Tanzil and Junaed Younus Khan and Gias Uddin},
journal= {arXiv preprint arXiv:2403.16347},
year = {2024}
}