从文本数据中对抗性移除人口统计属性
计算与语言
2018-09-05 v2 机器学习
机器学习
摘要
表示学习与对抗训练的最新进展似乎成功地从学习到的表示中移除了不需要的特征。我们表明,作者的 demographic 信息被编码在基于文本的神经网络分类器所学到的中间表示中,并且可以从中恢复。其含义是,在文本数据上训练的分类器的决策并非对 demographic 属性无关——而很可能以这些属性为条件。当尝试使用对抗训练来移除此类 demographic 信息时,我们发现,虽然对抗组件在训练期间达到了开发集的随机水平准确率,但在第一部分编码的句子上训练的事后分类器仍能在相同数据上达到明显更高的分类准确率。这种行为在多个任务、demographic 属性和数据集上是一致的。我们探索了若干技术来提升对抗组件的有效性。我们的主要结论是一个警示:不要依赖对抗训练来实现对敏感特征的不变表示。
引用
@article{arxiv.1808.06640,
title = {Adversarial Removal of Demographic Attributes from Text Data},
author = {Yanai Elazar and Yoav Goldberg},
journal= {arXiv preprint arXiv:1808.06640},
year = {2018}
}