中文

通过 API 文档缓解代码大语言模型幻觉问题

计算与语言 2024-07-17 v1 人工智能 机器学习

摘要

本研究针对软件工程各种情境下的 API 幻觉问题进行探讨。我们引入 CloudAPIBench—a 新的基准测试,用于衡量 API 幻觉发生的频率。CloudAPIBench 还提供了 API 在公开领域出现的频率注释,使我们能够在不同频率水平上研究 API 幻觉。我们的发现表明,代码大语言模型在低频 API 方面表现不佳:例如,GPT-4o 仅实现 38.58% 的有效低频 API 调用。我们演示了文档增强生成 (Documentation Augmented Generation, DAG) 显著�提高了低频 API 的性能(DAG 将其提升至 47.94%),但在使用次优检索器时,会对高频 API 产生负面影响(下降 39.02% 的绝对值)。为缓解此问题,我们提出在必要时智能地触发 DAG,其中我们检查 API 索引或利用代码大语言模型的置信度得分仅在需要时检索。我们证明了我们提出的方法提高了低频和高频 API 性能之间的平衡,导致更可靠的 API 调用(GPT-4o 在 CloudAPIBench 上实现 8.20% 的绝对提升)。

关键词

引用

@article{arxiv.2407.09726,
  title  = {On Mitigating Code LLM Hallucinations with API Documentation},
  author = {Nihal Jain and Robert Kwiatkowski and Baishakhi Ray and Murali Krishna Ramanathan and Varun Kumar},
  journal= {arXiv preprint arXiv:2407.09726},
  year   = {2024}
}