In-Context Learning 的可证明对抗鲁棒性
机器学习
2026-02-23 v1 机器学习
摘要
大型语言模型通过无需参数更新的方式进行上下文学习 (ICL)。当前对此能力的理论解释假设测试任务来自与预训练期间相似的分布。这种假设忽略了威胁实际可靠性的对抗分布偏移。为克服这一差距,我们引入基于 Wasserstein 距离的分布鲁棒元学习框架,为 ICL 在分布偏移下的最坏情况性能提供保证。聚焦于线性自注意力 Transformer,我们推导了将对抗扰动强度 ()、模型容量 () 和上下文示例数量 () 联系起来的非渐近界限。分析表明,模型鲁棒性随模型容量的平方根成比例增长 (),而对抗环境下的样本复杂度惩罚随扰动幅度的平方成正比 ()。合成任务上的实验确认了这些比例关系。这些发现推进了对 ICL 在对抗条件下极限的理论理解,表明模型容量是分布鲁棒性的基本资源。
引用
@article{arxiv.2602.17743,
title = {Provable Adversarial Robustness in In-Context Learning},
author = {Di Zhang},
journal= {arXiv preprint arXiv:2602.17743},
year = {2026}
}
备注
16 pages