WARP:面向 NLP Transformer 的保证性内部层修复
机器学习
2026-04-02 v1 人工智能
摘要
Transformer-based NLP 模型仍然对对抗性扰动十分脆弱,但现有的修复方法面临根本性权衡:梯度基于的方法灵活性强但缺乏可验证性且常常过拟合;提供修复保证的方法仅限于最后一层或小型网络,显著限制了可用于修复的参数搜索空间。我们提出了 WARP(Weight-Adjusted Repair with Provability,即权重调整修复与可验证性),一种基于约束的修复框架,将修复扩展到 Transformer 模型的除最后一层之外的其他层。WARP 将修复问题形式化为从逻辑间隙的一阶线性化派生的凸二次规划,使其能够在高维参数空间上进行可计算优化。在一阶近似成立的条件下,该公式引起三种每样本保证:(i) 正间隙约束确保修复后输入在正确分类上;(ii) 对指定保留集的保持约束;(iii) 来自 Lipschitz 连续性导出的认证鲁棒性半径。为确保不同模型架构的可行性,我们引入了一个基于灵敏度的预处理步骤,以相应地条件化优化景观。我们进一步表明,在 mild 假设下,迭代优化过程会收敛到满足所有修复约束的解。在不同层架构的编码器-only Transformer 上进行的实证评估表明,这些保证在实践中得以实现,同时提高了对对抗输入的鲁棒性。我们的结果表明,通过原则化的约束优化方法,能够实现具有可验证性和可泛化性的 Transformer 修复。
引用
@article{arxiv.2604.00938,
title = {WARP: Guaranteed Inner-Layer Repair of NLP Transformers},
author = {Hsin-Ling Hsu and Min-Yu Chen and Nai-Chia Chen and Yan-Ru Chen and Yi-Ling Chang and Fang Yu},
journal= {arXiv preprint arXiv:2604.00938},
year = {2026}
}