通过虚构面部身份数据集基准测试视觉语言模型遗忘
计算机视觉与模式识别
2025-03-10 v3
摘要
机器遗忘已成为一种遗忘训练数据中特定信息的有效策略。然而,随着视觉数据的日益整合,视觉语言模型中的隐私问题仍未得到充分探索。为解决这一问题,我们引入了面部身份遗忘基准(FIUBench),这是一个新颖的视觉语言模型遗忘基准,旨在稳健地评估在“被遗忘权”设置下遗忘算法的有效性。具体来说,我们通过构建虚构面部身份视觉问答数据集来形式化视觉语言模型遗忘任务,并应用一个两阶段评估流程,该流程旨在精确控制信息来源及其暴露水平。在评估方面,由于视觉语言模型支持多种具有相同语义含义的提问方式,我们还提供了稳健的评估指标,包括成员推断攻击和精心设计的对抗性隐私攻击,以评估算法的性能。通过在FIUBench内评估四种基线视觉语言模型遗忘算法,我们发现所有方法在遗忘性能上仍然有限,并且在模型效用和遗忘质量之间存在显著的权衡。此外,我们的发现也强调了隐私攻击对于稳健评估的重要性。我们希望FIUBench将推动开发更有效的视觉语言模型遗忘算法的进展。
引用
@article{arxiv.2411.03554,
title = {Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset},
author = {Yingzi Ma and Jiongxiao Wang and Fei Wang and Siyuan Ma and Jiazhao Li and Jinsheng Pan and Xiujun Li and Furong Huang and Lichao Sun and Bo Li and Yejin Choi and Muhao Chen and Chaowei Xiao},
journal= {arXiv preprint arXiv:2411.03554},
year = {2025}
}