中文

揭示与量化代码生成中的社会偏见

计算与语言 2023-05-25 v1

摘要

随着 Copilot 等自动代码生成工具的普及,对这些工具潜在危害的研究日益重要。本工作中,我们探究预训练代码生成模型中的社会偏见问题。我们提出一种构建代码提示的新范式,并成功揭示了代码生成模型中的社会偏见。为量化生成代码中的社会偏见严重程度,我们构建了一个数据集及三个指标,以评估整体社会偏见及不同人口群体间的细粒度不公平性。在三个不同规模的预训练代码生成模型(Codex、InCoder 和 CodeGen)上的实验结果显示出严重的社会偏见。此外,我们进行分析以提供有用见解,助力进一步选择低社会偏见的代码生成模型。(本工作包含可能暗示刻板印象、关联及其他对某些社会群体个体具冒犯性的危害的示例。)

关键词

引用

@article{arxiv.2305.15377,
  title  = {Uncovering and Quantifying Social Biases in Code Generation},
  author = {Yan Liu and Xiaokang Chen and Yan Gao and Zhe Su and Fengji Zhang and Daoguang Zan and Jian-Guang Lou and Pin-Yu Chen and Tsung-Yi Ho},
  journal= {arXiv preprint arXiv:2305.15377},
  year   = {2023}
}