中文

论分布偏移下公共表示对私有迁移学习的好处

机器学习 2025-09-10 v5 密码学与安全 机器学习

摘要

公共预训练是改进差分隐私模型训练的一种有前景的方法。然而,最近的工作指出,许多研究该范式的积极结果只考虑了分布内任务,可能不适用于预训练数据和微调数据之间存在分布偏移的情况——由于数据的敏感性,微调私有任务时很可能出现这种情况。在这项工作中,我们在三个任务上经验性地表明,即使在存在大分布偏移的情况下,当公共数据的零样本性能和从头开始使用私有数据训练都给出不可用的弱结果时,公共特征实际上可以将私有训练准确率比从头开始的私有训练提高高达67%。我们为这一现象提供了理论解释,表明如果公共数据和私有数据共享一个低维表示,那么即使无法仅从公共数据学习私有任务,公共表示也可以提高私有训练的样本复杂度。总之,我们的结果提供了证据,表明在极端分布偏移的现实环境中,公共数据确实可以使私有训练变得实用。

关键词

引用

@article{arxiv.2312.15551,
  title  = {On the Benefits of Public Representations for Private Transfer Learning under Distribution Shift},
  author = {Pratiksha Thaker and Amrith Setlur and Zhiwei Steven Wu and Virginia Smith},
  journal= {arXiv preprint arXiv:2312.15551},
  year   = {2025}
}

备注

Published in NeurIPS 2024