中文

技术报告理解中 ChatGPT 不准确性的缓解:我们到了吗?

软件工程 2024-11-13 v1

摘要

幻觉,即生成无关/错误响应的倾向,是 ChatGPT 等生成式 AI 工具普遍存在的问题。尽管针对文本响应的 ChatGPT 幻觉已被研究,但 ChatGPT 如何为同时包含文本和技术术语的技术文本产生幻觉尚不清楚。我们调查了 47 名软件工程师,并从两个开源软件项目的缺陷报告中构建了包含 412 组问答对的基准。我们发现,基于 RAG 的 ChatGPT(即用基准问题报告微调的 ChatGPT)在回答问题时仅有 36.4% 的正确率,原因有二:1) 理解代码片段(如堆栈跟踪)中复杂技术内容的能力有限,2) 整合技术术语和文本中表示的上下文的能力有限。我们提出了 CHIME(ChatGPT 不准确性缓解引擎),其基本原理是:如果我们能更好地预处理技术报告并引导 ChatGPT 中的查询验证过程,就能解决上述局限。CHIME 使用上下文无关文法 (CFG) 解析技术报告中的堆栈跟踪。随后,CHIME 通过应用变异测试和查询变换来验证和修正 ChatGPT 的响应。在我们的基准上,CHIME 相比 ChatGPT 原始响应提升了 30.3% 的修正率。在用户研究中,我们发现使用 CHIME 改进后的响应被认为比未使用 CHIME 的 ChatGPT 生成的响应更有用。

关键词

引用

@article{arxiv.2411.07360,
  title  = {ChatGPT Inaccuracy Mitigation during Technical Report Understanding: Are We There Yet?},
  author = {Salma Begum Tamanna and Gias Uddin and Song Wang and Lan Xia and Longyu Zhang},
  journal= {arXiv preprint arXiv:2411.07360},
  year   = {2024}
}