中文

共享你的模型而非数据:用于排序的隐私保护模仿学习

信息检索 2017-07-25 v1 人工智能 计算与语言 机器学习

摘要

深度神经网络已成为解决许多领域问题的主要工具。它们也被用于处理信息检索问题,并在多项任务中展现出强大的性能。训练这些模型需要大规模且具代表性的数据集,而对于大多数信息检索(IR)任务而言,此类数据包含来自用户的敏感信息。隐私与保密顾虑使得许多数据拥有者无法共享数据,因此当今研究界只能以有限的方式从大规模数据集的研究中受益。在本文中,我们讨论了隐私保护模仿学习,即使用经隐私保护训练的模型的预测结果,而非来自原始敏感训练数据的标签作为监督信号。我们展示了初步实验的结果,其中我们将模仿学习与隐私保护模仿学习的思想应用于文档重排序这一核心 IR 任务。这项研究是迈向为数据丰富环境中的研究者奠定基础的一步,使其能够共享从真实用户数据中学到的知识,这将促进研究合作。

关键词

引用

@article{arxiv.1707.07605,
  title  = {Share your Model instead of your Data: Privacy Preserving Mimic Learning for Ranking},
  author = {Mostafa Dehghani and Hosein Azarbonyad and Jaap Kamps and Maarten de Rijke},
  journal= {arXiv preprint arXiv:1707.07605},
  year   = {2017}
}

备注

SIGIR 2017 Workshop on Neural Information Retrieval (Neu-IR'17)}{}{August 7--11, 2017, Shinjuku, Tokyo, Japan