中文

隐私微调的大语言模型保留表格数据中的时序动态

机器学习 2026-02-04 v1 计算与语言 密码学与安全

摘要

关于差分隐私合成表格数据的研究主要关注独立同分布的行,其中每条记录对应唯一个体。这种视角忽略了纵向数据集中如电子健康记录等的时间复杂性,其中用户贡献整个(子)表格的序列事件。虽然实践者可能尝试通过将用户历史展平为高维向量来使用标准边际机制建模此类数据,但我们展示该策略不足。展平无法即使保持有效的边际分布而保持时序一致性。我们引入 PATH,一种新的生成框架,将完整表格作为合成单元,并利用隐私微调大语言模型的自回归能力。广泛评估显示,PATH 有效捕获传统方法遗漏的长程依赖。经验上,我们的方法将与真实轨迹的分布距离降低超过 60%,相对于领先的边际机制将状态转移错误降低近 50%,同时实现类似的边际保真度。

关键词

引用

@article{arxiv.2602.02766,
  title  = {Privately Fine-Tuned LLMs Preserve Temporal Dynamics in Tabular Data},
  author = {Lucas Rosenblatt and Peihan Liu and Ryan McKenna and Natalia Ponomareva},
  journal= {arXiv preprint arXiv:2602.02766},
  year   = {2026}
}