中文

技术问题回答中的对话模型与人类的比较:以 Firefox 为例

软件工程 2025-10-28 v1 人工智能

摘要

大规模语言模型(LLM)用于支持软件开发任务的应用近年来不断增长,从辅助开发人员进行编码活动到提供回答新手问题的对话式代理。本研究与 Mozilla 基金会合作,评估了检索增强生成(RAG)在 Mozilla Firefox 项目中辅助开发人员的效果。我们对比了来自人类开发人员、标准 GPT 模型和使用 RAG 提升的 GPT 模型的响应,基于来自 Mozilla 开发者聊天室的真实查询进行评估。为确保严格的评估,Mozilla 专家根据有用性、完整性和简洁性对响应进行评估。结果表明,RAG 辅助的响应在完整性上优于人类开发人员(62.50% vs 54.17%),且几乎同样有用(75.00% vs 79.17%),表明 RAG 有潜力提升开发人员辅助。然而,RAG 响应不够简洁,往往过于冗长。结果表明,RAG 基于工具可被应用于开源软件(OSS),以在不牺牲答案质量的情况下减轻核心维护者的负担。在未来,调低检索机制并使响应更简短将增强开发人员在像 Mozilla Firefox 这样的大型项目中的辅助功能。

关键词

引用

@article{arxiv.2510.21933,
  title  = {A Comparison of Conversational Models and Humans in Answering Technical Questions: the Firefox Case},
  author = {Joao Correia and Daniel Coutinho and Marco Castelluccio and Caio Barbosa and Rafael de Mello and Anita Sarma and Alessandro Garcia and Marco Gerosa and Igor Steinmacher},
  journal= {arXiv preprint arXiv:2510.21933},
  year   = {2025}
}

备注

13 pages