MobText-SISA:面向时空与自然语言移动日志的高效机器学习遗忘方法
计算机视觉与模式识别
2025-08-28 v1
摘要
现代移动平台存储了GPS轨迹、时间元数据、自由格式文本笔记和其他非结构化数据的庞大流。GDPR等隐私法规要求任何个人的贡献可被按需遗忘,然而为每个请求从头重新训练深度模型是不可行的。我们提出了MobText-SISA,一个可扩展的机器学习遗忘框架,将分片、隔离、切片与聚合(SISA)训练扩展至异构时空数据。MobText-SISA首先将每次出行的数值和语言特征嵌入共享隐空间,然后采用相似感知的聚类将样本分布到各分片中,使得未来的删除操作仅触及单个子模型同时保持分片间的多样性。每个分片增量训练;在推理时,子模型预测被聚合以产生输出。删除请求仅从最后一个有效检查点重新训练受影响的分片,保证精确遗忘。在十个月真实移动轨迹日志上的实验表明,MobText-SISA (i) 保持了基线预测准确性,(ii) 在误差和收敛速度两方面始终优于随机分片。这些结果确立了MobText-SISA作为城市规模多模态移动数据隐私合规分析的实际基础。
引用
@article{arxiv.2508.19555,
title = {MonoRelief V2: Leveraging Real Data for High-Fidelity Monocular Relief Recovery},
author = {Yu-Wei Zhang and Tongju Han and Lipeng Gao and Mingqiang Wei and Hui Liu and Changbao Li and Caiming Zhang},
journal= {arXiv preprint arXiv:2508.19555},
year = {2025}
}