关于使用地方媒体数据训练语言生成模型所产生的非预期社会偏见
计算与语言
2019-11-04 v1 机器学习
摘要
人们担忧神经语言模型可能保留生成训练这些模型所需大规模语料的社会中的一些刻板印象。例如,性别偏见在文本生成中是一个显著问题,其非预期记忆可能影响许多应用的用户体验(如 Gmail 中的智能撰写功能)。在本文中,我们引入一种新颖架构,将神经模型的表示学习与其记忆管理角色解耦。该架构允许我们以跨性别类型的相等比例更新记忆模块,从而在潜空间中直接处理有偏相关性。我们通过实验表明,在扩展 Sequence2Sequence 架构时,我们的方法能够在提供相似困惑度值的同时,缓解新闻文章自动生成中的性别偏见放大。
引用
@article{arxiv.1911.00461,
title = {On the Unintended Social Bias of Training Language Generation Models with Data from Local Media},
author = {Omar U. Florez},
journal= {arXiv preprint arXiv:1911.00461},
year = {2019}
}