基于大语言模型的少样本类递增学习自动攻击发现
机器学习
2025-12-04 v1
摘要
少样本类递增学习 (FSCIL) 是持续学习中更真实且更具挑战性的范式,旨在仅凭少量训练样本 incrementally 学习未知类别并克服 base 类别上的灾难性遗忘。以往的工作主要集中于研究更有效的 FSCIL 方法,而对 FSCIL 安全问题的关注则寡言。本文旨在全面研究攻击对 FSCIL 的影响。我们首先通过系统性探索人类专家设计的攻击方法 (如 PGD、FGSM) 对 FSCIL 的影响,获得洞见。我们发现,这些方法要么无法攻击 base 类别,要么因依赖庞大的专家知识而产生巨大的劳动成本。这凸显了为 FSCIL 量身定制专门攻击方法的必要性。基于这些洞见,本文提出一种简单且高效的 ACraft 方法,通过利用大语言模型 (LLM) 实现自动引导和发现针对 FSCIL 的最优攻击方法,从而无需人类专家。此外,为提高 LLM 与 FSCIL 之间的推理能力,我们引入一种新颖的基于 Proximal Policy Optimization (PPO) 的强化学习,以优化学习,使 LLM 在下一代中生成更好的攻击方法,通过建立正反馈。在主流基准测试上的实验表明,我们的 ACraft 在显著降低 SOTA FSCIL 方法性能方面取得显著效果,并且在保持最低攻击成本的同时,超越了人类专家设计的攻击方法。
引用
@article{arxiv.2512.03882,
title = {Automatic Attack Discovery for Few-Shot Class-Incremental Learning via Large Language Models},
author = {Haidong Kang and Wei Wu and Hanling Wang},
journal= {arXiv preprint arXiv:2512.03882},
year = {2025}
}