语言模型决策中歧视的评估与缓解
计算与语言
2023-12-07 v1
摘要
随着语言模型(LMs)的进步,将其应用于高风险社会决策(如确定贷款或住房资格)的兴趣日益增长。然而,它们在此类情境中产生歧视的潜力引发了伦理担忧,促使需要更好的方法来评估这些风险。我们提出了一种方法,用于主动评估 LMs 在广泛用例(包括尚未部署的假设用例)中的潜在歧视性影响。具体而言,我们使用 LM 生成决策者可能输入到 LM 中的大量潜在提示,涵盖社会中的 70 种不同决策场景,并系统性地改变每个提示中的人口统计信息。应用该方法论揭示了在无干预措施的情况下,Claude 2.0 模型在特定场景中表现出正向和负向歧视的模式。尽管我们不认可也不允许将语言模型用于我们所研究的高风险用例的自动化决策,但我们展示了通过精心设计的提示工程显著减少正向和负向歧视的技术,为在可能适用的用例中实现更安全的部署提供了路径。我们的工作使开发者和政策制定者能够在语言模型能力和应用持续扩展时,预见、测量并应对歧视问题。我们在 https://huggingface.co/datasets/Anthropic/discrim-eval 发布了我们的数据集和提示。
引用
@article{arxiv.2312.03689,
title = {Evaluating and Mitigating Discrimination in Language Model Decisions},
author = {Alex Tamkin and Amanda Askell and Liane Lovitt and Esin Durmus and Nicholas Joseph and Shauna Kravec and Karina Nguyen and Jared Kaplan and Deep Ganguli},
journal= {arXiv preprint arXiv:2312.03689},
year = {2023}
}