中文

ICU-Bench:面向多模态大语言模型的持续忘却基准测试

人工智能 2026-05-08 v1

摘要

尽管多模态大语言模型(MLLM)在诸多领域取得了显著进展,但其在大规模多模态数据集上的训练引发了严重的隐私担忧,使得有效的机器忘却变得日益必要。然而,现有基准主要关注静态或短序列场景,难以支持现实部署中对持续隐私删除请求的评估。为弥合这一差距,我们引入 ICU-Bench,这是一个基于隐私敏感文档数据构建的持续多模态忘却基准。ICU-Bench 包含来自两个文档领域(医学报告和劳动合同)的 1,000 份隐私敏感档案,包含 9,500 张图片、16,000 条问答对以及 100 个忘却任务。此外,本文引入了新的持续忘却指标,促进对忘却效果、历史忘却保持、保留实用性以及整个持续忘却过程中稳定性的全面分析。通过在 ICU-Bench 上对代表性忘却方法进行大量实验,我们表明现有方法在持续场景中普遍难以处理,在在忘却质量、实用性保持和长期任务序列的可扩展性之间表现出明显局限。这些发现凸显了面向持续隐私删除设计的多模态忘却方法的必要性。

关键词

引用

@article{arxiv.2605.05938,
  title  = {ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models},
  author = {Yuhang Wang and Wenjie Mei and Junkai Zhang and Guangyu He and Zhenxing Niu and Haichang Gao},
  journal= {arXiv preprint arXiv:2605.05938},
  year   = {2026}
}

备注

30 pages, 12 figures