中文

面向语言赋能基础模型的可证明鲁棒适应

机器学习 2025-10-13 v1 人工智能

摘要

语言赋能基础模型(LeFMs),如 CLIP 和 GraphCLIP,已通过将视觉(或图)特征与文本表示对齐,变革了多模态学习,使其能够实现如零样本学习等强大的下游能力。然而,这些模型依赖的小型、特定于任务的支持数据集收集于开放环境中,暴露了这些模型面临投毒攻击的风险,即敌对方操纵支持样本以降低性能。现有防御措施依赖经验性策略,缺乏形式化保证且仍然 vulnerable to 未知和自适应攻击。认证鲁棒性提供可证明的保证,但在基于 LeFMs 的少样本分类器方面仍被大大忽略。本研究旨在填补这些关键性空白,提出首个针对 LeFMs 的可证明鲁棒少样本分类器。我们称之为 Language-empowered Few-shot Certification(\textbf{LeFCert})。它集成了文本嵌入与特征嵌入,并采用自适应混合机制。为实现可证明鲁棒性,我们提出了两次修剪均值原型,并推导了分类得分的可证明上界和下界,从而在最坏情况投毒情景下实现认证。为进一步提升性能,我们通过考虑更现实且更严格的攻击预算,对 LeFCert 进行了两个变体扩展:LeFCert-L 集成了随机光滑化,以实现 Lipschitz 连续性并在双预算约束下实现鲁棒性;LeFCert-C 提供集体认证,用于攻击者在多个样本上分布共享投毒预算的情形。实验表明,LeFCert 实现了业界最佳性能,显著提升了干净数据和认证准确率。尽管具备先进的鲁棒性机制,LeFCert 仍具备计算效率,适用于实际应用。

关键词

引用

@article{arxiv.2510.08659,
  title  = {Provably Robust Adaptation for Language-Empowered Foundation Models},
  author = {Yuni Lai and Xiaoyu Xue and Linghui Shen and Yulun Wu and Gaolei Li and Song Guo and Kai Zhou and Bin Xiao},
  journal= {arXiv preprint arXiv:2510.08659},
  year   = {2025}
}

备注

19 pages