中文

从不返回空结果:面向提升 LLM 开发者支持的自适应 HyDE 检索

软件工程 2025-07-23 v1 人工智能

摘要

大型语言模型(LLM)在辅助开发者解答代码相关问题方面显示出前景,但LLM存在生成不可靠答案的风险。为此,提出了检索增强生成(RAG)以减少LLM的不可靠性(即幻觉)。然而,设计有效的管道仍具挑战性 due to 众多设计选择。本文构建了包含300多万篇Java和Python相关Stack Overflow帖子(带接受答案)的检索语料库,并探讨 various RAG管道设计,以解答开发者提问,评估其在生成准确可靠响应方面的效果。更具体地说,我们(1)设计并评估了7种不同的RAG管道和63个管道变体以解答历史上具有相似匹配的提问,(2)通过在检索时自动降低相似度阈值来处理无近期匹配的新问题,从而增加找到部分相关上下文的机会,提高对未见情况的覆盖率。我们发现,实现将假设文档嵌入(HyDE)与完整答案上下文相结合的RAG管道在检索和回答相似内容方面效果最佳。最后,我们将最优RAG管道应用于4个开源LLM,并将结果与其零样本性能进行比较。我们的发现表明,结合我们最优RAG管道的RAG在不同LLM中 consistently 超过零样本基线, 在有用性、正确性和详细信息方面获得更高分数(LLM作为评判者)。这些发现表明,我们的 最优RAG管道对广泛的开发者查询(包括以前看到的和 novel 的问题)在不同LLM中均能稳健地提升答案质量。

关键词

引用

@article{arxiv.2507.16754,
  title  = {Never Come Up Empty: Adaptive HyDE Retrieval for Improving LLM Developer Support},
  author = {Fangjian Lei and Mariam El Mezouar and Shayan Noei and Ying Zou},
  journal= {arXiv preprint arXiv:2507.16754},
  year   = {2025}
}