超越像素的隐私:面向隐私保护视频理解的潜在匿名化
计算机视觉与模式识别
2026-04-06 v2
摘要
我们为视频基础模型引入了一种全新的视觉隐私保护公式化方法,该方法完全在潜在空间中运行。虽然基础模型学习的时空特征加深了对视频内容的通用理解,但共享或存储这些提取的视觉特征用于下游任务会无意中泄露敏感的个人信息,如肤色、性别或衣着。当前的隐私保护方法侧重于输入像素级匿名化,这需要重新训练整个效用视频模型,并导致特定于任务的匿名化,使其不适用于近期的视频基础模型。为了应对这些挑战,我们引入了一个轻量级的匿名化适配器模块,该模块在保留通用任务效用的同时,从视频特征中移除隐私信息。AAM可以以即插即用的方式应用于冻结的视频编码器,从而最小化微调和重新提取特征的计算负担。我们的框架采用了三个新设计的训练目标:(1)片段级自监督隐私目标,用于减少静态片段之间的互信息,(2)协同训练目标,用于在已见任务中保持效用,以及(3)潜在一致性损失,用于在未见任务上进行泛化。我们广泛的评估表明,隐私泄露显著减少了35%,同时在各种下游任务中保持了接近基线的效用性能:动作识别(Kinetics400、UCF101、HMDB51)、时序动作检测(THUMOS14)和异常检测(UCF-Crime)。我们还分析了针对敏感时序属性识别的匿名化。此外,我们提出了评估动作识别模型中性别偏见的新协议,表明我们的方法有效缓解了此类偏见,并促进了更公平的视频理解。https://joefioresi718.github.io/SPLAVU_webpage/
引用
@article{arxiv.2511.08666,
title = {Privacy Beyond Pixels: Latent Anonymization for Privacy-Preserving Video Understanding},
author = {Joseph Fioresi and Ishan Rajendrakumar Dave and Mubarak Shah},
journal= {arXiv preprint arXiv:2511.08666},
year = {2026}
}
备注
Accepted to ICLR 2026