中文

你好,我是玛莎:利用名字度量并缓解生成式对话模型中的偏见

计算与语言 2021-09-09 v1

摘要

所有 AI 模型都容易学到训练数据中的偏见。对于生成式对话模型,在包含不平衡的性别与种族/民族指称的真实人类对话上训练,可能导致模型表现出习得偏见;我们在此将其广义地定义为:基于人口统计群体的对话中词语或语义内容分布的任意可度量差异。我们通过让对话模型的两个副本生成人工对话来度量此类偏见的强度,其中将一个对话方设定为说出通常与某一性别和/或种族/民族相关联的名字。我们发现,容量更大的模型往往表现出更强的性别偏见,以及更严重的按性别对职业的刻板印象。我们展示了几种调优这些对话模型的方法——具体而言,名字打乱、受控生成和不可能性训练——能有效减少对话中的偏见,包括在一个下游对话任务上。名字打乱在降低对话伙伴拥有与不同性别或种族/民族相关联名字时词元使用差异方面也同样有效。

关键词

引用

@article{arxiv.2109.03300,
  title  = {Hi, my name is Martha: Using names to measure and mitigate bias in generative dialogue models},
  author = {Eric Michael Smith and Adina Williams},
  journal= {arXiv preprint arXiv:2109.03300},
  year   = {2021}
}