中文

从像素到隐私:通过令牌剪枝实现时间一致性视频匿名化以进行隐私保护动作识别

计算机视觉与模式识别 2026-03-30 v1

摘要

大规模视频模型的最新进展显著提升了视频理解在监控、医疗和娱乐等领域的应用。然而,这些模型也通过编码敏感属性(包括面部身份、种族和性别)放大了隐私风险。虽然图像匿名化已被广泛研究,但视频匿名化仍相对未被充分探索,尽管现代视频模型可以利用时空运动模式作为生物特征标识符。为应对这一挑战,我们提出了一种新颖的注意力驱动的时空视频匿名化框架,基于效用特征和隐私特征的系统性解耦。我们的关键洞察是,Vision Transformer(ViT)中的注意力机制可以被显式结构化,以分离动作相关信息与隐私敏感内容。基于这一洞察,我们引入了两个任务特定的分类令牌——动作 CLS 令牌和隐私 CLS 令牌——它们在共享的 Transformer 主干中学习互补表示。我们对比它们的注意力分布来计算每个时空管段的效用-隐私分数,并保留得分最高的前 k 个管段。这选择性地剪枝了由隐私线索主导的管段,同时保留了对抗动作识别最为关键的管段。大量实验表明,我们的方法在保持与在原始视频上训练的模型相当的动作识别性能的同时,显著降低了隐私泄露。这些结果表明,注意力驱动的时空剪枝为隐私保护视频分析提供了一种有效且原理性的解决方案。

关键词

引用

@article{arxiv.2603.26336,
  title  = {From Pixels to Privacy: Temporally Consistent Video Anonymization via Token Pruning for Privacy Preserving Action Recognition},
  author = {Nazia Aslam and Abhisek Ray and Joakim Bruslund Haurum and Lukas Esterle and Kamal Nasrollahi},
  journal= {arXiv preprint arXiv:2603.26336},
  year   = {2026}
}

备注

10 pages, CVPR paper