中文

通过多视角用户偏好排序反馈对齐大语言模型以用于编程问答

计算与语言 2024-06-04 v1 人工智能

摘要

代码社区问答旨在解决编程相关问题,从而提高软件工程和学术研究的生产力。近期人类反馈强化学习的进展已经改变了大型语言模型的微调过程,使其能够生成与人类行为高度相似的响应。因此,利用带有强化学习的人类反馈的大型语言模型进行实际的代码社区问答应用已成为一个前景广阔的研究领域。与标准代码问答任务不同,代码社区问答涉及多个可能的答案,且每个响应的用户偏好各不相同。此外,代码社区通常偏好新的API。这些挑战阻碍了大型语言模型在代码社区问答任务中生成满足用户多样化偏好的响应。为了解决这些问题,我们提出了一个名为ALMupQA的新颖框架,用于创建以用户为中心的响应。我们的方法从多视角偏好排序对齐开始,该模块基于代码社区答案的特征综合了多样化的用户偏好。然后,我们引入了一个检索增强的上下文学习模块,通过从问题库中检索类似问题的答案来缓解答案过时的问题。由于缺乏高质量、多答案的代码社区问答数据集,我们还从真实代码社区开发了一个名为StaCCQA的数据集。大量实验证明了ALMupQA框架在准确性和用户偏好方面的有效性。与基础模型相比,ALMupQA在BLEU上提升了近11%,在BERTScore和CodeBERTScore上分别提升了20%和17.5%。

关键词

引用

@article{arxiv.2406.00037,
  title  = {Aligning LLMs through Multi-perspective User Preference Ranking-based Feedback for Programming Question Answering},
  author = {Hongyu Yang and Liyang He and Min Hou and Shuanghong Shen and Rui Li and Jiahui Hou and Jianhui Ma and Junda Zhao},
  journal= {arXiv preprint arXiv:2406.00037},
  year   = {2024}
}