TraceHiding:面向移动数据可扩展机器遗忘框架
机器学习
2025-09-23 v1 计算机与社会
摘要
本工作提出TraceHiding,一个面向移动轨迹数据的可扩展、重要性感知的机器遗忘框架。受GDPR和CCPA等隐私法规赋予用户“被遗忘权”的启发,TraceHiding能够在不进行完整再训练的情况下,从训练好的深度模型中移除指定用户轨迹。它结合了基于层次数据驱动的重要性评分方案与教师-学生蒸馏。重要性评分基于统计属性(覆盖度、多样性、熵、长度)在token、轨迹和用户三个层级计算,量化了每个训练样本的影响,从而实现对高影响数据的精准遗忘,同时保留常见模式。学生模型在保持剩余数据知识的同时,通过重要性加权损失实现轨迹遗忘,该损失对独特样本放大遗忘信号,对频繁样本则削弱信号。我们在多个真实世界高阶移动数据集(HO-Rome、HO-Geolife、HO-NYC)上的轨迹-用户链接(TUL)任务中进行验证,涵盖多种网络结构(GRU、LSTM、BERT、ModernBERT、GCN-TULHOR),并对抗性遗忘基线包括SCRUB、NegGrad、NegGrad+、Bad-T和Finetuning。均匀和目标化用户删除实验表明,TraceHiding(尤其是基于熵的变体)在遗忘准确性、成员推断攻击(MIA)韧性方面均表现优异,相较于重新训练可实现最高40倍加速,同时保持极小的测试精度损失。结果表明该方法对高信息用户的对抗删除具有良好鲁棒性,且在不同模型间表现一致。据我们了解,这是首个针对轨迹数据的机器遗忘系统性研究,提供了可复现的管道,附带公共代码和预处理工具。
引用
@article{arxiv.2509.17241,
title = {TraceHiding: Scalable Machine Unlearning for Mobility Data},
author = {Ali Faraji and Manos Papagelis},
journal= {arXiv preprint arXiv:2509.17241},
year = {2025}
}