提示扰动何时破坏生成?基于 LoRA 微调语言模型的分段鲁棒性视角
计算与语言
2026-05-05 v1 人工智能
摘要
大型语言模型对微小提示扰动敏感,但现有鲁棒性方法通常在整体序列层面强制一致性。这类全局观察可能会隐藏一个重要失效模式:扰动后的响应可能与干净版本在整体上相似,但在关键实体、关系或结论上发生漂移。我们引入 SR(Segment-level Robustness for LoRA),一个针对 LoRA 微调的分段鲁棒性框架。SR 将干净与扰动生成分解为语义分段,通过最优传输目标对齐它们,并对产生最大意义漂移的分段施加惩罚。为将该输出侧目标与模型适配相结合,我们添加了一个以分段级注意力重新分配为灵感的适配器稳定性正则化器,使用 LoRA 范数控制作为限制扰动放大证据偏移的可计算代理。进一步的 PAC-Bayesian 复杂度视角解释了为何控制适配器增长可能支持迁移学习超出观察到的扰动。总结基准测试中的实验表明,SR 在拼写错误噪声、删除、同义替换和改写等情形下提升了鲁棒性,同时保持了竞争力的干净性能和更强的跨数据集迁移能力,优于基于一致性的基线。
关键词
引用
@article{arxiv.2605.01605,
title = {Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models},
author = {Zhuoyun Li and Boxuan Wang and Jinwei Hu and Zhenglin Huang and Qisong He and Xinmiao Huang and Guangliang Cheng and Xiaowei Huang and Yi Dong},
journal= {arXiv preprint arXiv:2605.01605},
year = {2026}
}
备注
Under review