中文

性别化提示与 LLM 代码审查:提示中的性别线索如何影响代码质量与评估

软件工程 2026-03-26 v1 人机交互

摘要

LLM 正在越来越多地嵌入编程工作流程,从代码生成到自动化代码审查。然而,性别化交流风格如何与 LLM 辅助编程和代码审查相互作用仍未得到充分探讨。我们提出了一项混合方法的 pilot 研究,检验性别相关语言差异在提示中是否影响代码生成结果和代码审查决策。我们对三项互补研究进行分析:(i) 收集的真实世界编程提示,(ii) 一项受控用户研究,其中开发人员在 LLM 辅助下解决相同的编程任务,以及 (iii) 一个 LLM 基于的模拟评估框架,系统性地变异性别编码提示风格和审阅人角色。我们发现,提示风格中的性别差异虽微小但可测量,女性撰写的提示呈现更间接和涉及性的语言,这并未导致功能正确性或静态代码质量存在持续的差距。在 LLM 代码审查方面,我们则观察到系统性偏见:平均而言,模型批准女性撰写的代码更多,尽管质量相当。受控实验表明,性别编码的提示风格影响代码长度和可维护性,而审阅者行为在不同模型之间存在差异。我们的发现表明,LLM 辅助编程中的公平风险主要来自 LLM 的评估而非生成准确性,因为 LLM 正在日益被部署为自动化代码审阅员。

关键词

引用

@article{arxiv.2603.24359,
  title  = {Gendered Prompting and LLM Code Review: How Gender Cues in the Prompt Shape Code Quality and Evaluation},
  author = {Lynn Janzen and Üveys Eroglu and Dorothea Kolossa and Pia Knöferle and Sebastian Möller and Vera Schmitt and Veronika Solopova},
  journal= {arXiv preprint arXiv:2603.24359},
  year   = {2026}
}