中文

Vid-SME:针对大型视频理解模型的成员推理攻击

计算机视觉与模式识别 2025-06-05 v1 人工智能

摘要

多模态大语言模型(MLLMs)在处理复杂多模态任务方面展现出卓越能力,并日益被应用于视频理解领域。然而,其快速发展引发了严重的数据隐私担忧,特别是考虑到训练数据集中可能包含个人录像和监控录像等敏感视频内容。确定训练过程中是否不当使用了特定视频,仍是一个关键且未解决的挑战。尽管针对 MLLMs 中文本和图像数据的成员推理攻击(MIAs)已取得相当进展,但现有方法难以有效泛化至视频领域。这些方法在采样更多帧时存在可扩展性差的问题,且在低假阳性率下的真阳性率(TPR@Low FPR)通常可忽略不计,主要原因在于它们未能捕捉视频帧固有的时序变化,也未能考虑帧数变化时模型行为的差异。为应对这些挑战,我们引入 Vid-SME,这是首个针对视频理解大语言模型(VULLMs)中视频数据量身定制的成员推理方法。Vid-SME 利用模型输出的置信度,并集成自适应参数化来计算视频输入的 Sharma-Mittal 熵(SME)。通过利用自然视频帧与时序反转视频帧之间的 SME 差异,Vid-SME 推导出鲁棒的成员分数,以判定给定视频是否属于模型训练集的一部分。在多种自训练和开源 VULLMs 上的实验证明了 Vid-SME 的强有效性。

关键词

引用

@article{arxiv.2506.03179,
  title  = {Vid-SME: Membership Inference Attacks against Large Video Understanding Models},
  author = {Qi Li and Runpeng Yu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2506.03179},
  year   = {2025}
}