迈向鲁棒且保护隐私的文本表示
计算与语言
2018-05-17 v1
摘要
书面文本通常提供充分的线索来识别作者、其性别、年龄及其他重要属性。因此,训练和评测语料的作者身份可能产生未预见的影响,包括不同用户组的模型性能差异,以及隐私问题。在本文中,我们提出一种在训练时显式掩盖重要作者特征的方法,使得学习到的表示对这些属性保持不变。在两个任务上评测,我们表明这带来了学习表示中增强的隐私,以及对变化评测条件(包括域外语料)更具鲁棒性的模型。
引用
@article{arxiv.1805.06093,
title = {Towards Robust and Privacy-preserving Text Representations},
author = {Yitong Li and Timothy Baldwin and Trevor Cohn},
journal= {arXiv preprint arXiv:1805.06093},
year = {2018}
}
备注
Accepted to ACL 2018