基于公共知识蒸馏的隐私感知时间序列合成
机器学习
2025-11-04 v1
摘要
在金融、医疗和能源消耗等领域,由于隐私顾虑,分享敏感时间序列数据往往受到限制,例如患者记录或投资账户。在金融领域,敏感序列常与公开可用、非敏感的上下文元数据相关联(例如,家庭用电量可能受天气条件和电价影响)。然而,现有的隐私感知数据生成方法常常忽视了这一机会,导致隐私-效用权衡次优。在本文中,我们提出Pub2Priv,一种 novel框架,通过利用异构公共知识生成私人时间序列数据。我们的模型采用自注意力机制将公共数据编码为temporal和feature嵌入,这些嵌入作为扩散模型的条件输入,用于生成synthetic私人序列。此外,我们引入一种实用指标来评估隐私,通过评估synthetic数据的可识别性。实验结果表明,Pub2Priv在金融、能源和商品交易领域均 consistently 优于最先进的基准,在改善隐私-效用权衡方面表现突出。
引用
@article{arxiv.2511.00700,
title = {Privacy-Aware Time Series Synthesis via Public Knowledge Distillation},
author = {Penghang Liu and Haibei Zhu and Eleonora Kreacic and Svitlana Vyetrenko},
journal= {arXiv preprint arXiv:2511.00700},
year = {2025}
}
备注
Published on Transactions on Machine Learning Research (TMLR)