中文

面向自然语言生成的抗投毒鲁棦性认证

机器学习 2026-02-11 v1

摘要

理解自然语言生成的可靠性对于在安全敏感领域部署基础模型至关重要。虽然认证投毒防御为分类任务提供可证明的鲁棒性边界, 但其基本不适用于自回归生成:它们无法处理顺序预测或语言模型指数级的输出空间。为建立面向认证自然语言生成的框架, 我们形式化了两种安全属性: 稳定性(对任何生成变更的鲁棒性)和有效性(对针对性有害变更的鲁棒性)。我们引入了目标分区聚合 (TPA), 首个能够通过计算引发特定有害类别、标记或短语所需的最小投毒预算来认证有效性/针对性攻击的算法。进一步, 我们将 TPA 扩展到使用混合整数线性规划 (MILP) 提供更紧密的多轮生成保证。实验结果表明, TPA 在包括: 当对抗者修改最高达 0.5% 数据时认证代理工具调用有效性, 以及在基于偏好的对齐中认证 8 标记稳定性范围内, 其效果显著。尽管推理时延仍是开放问题, 但我们的贡献使语言模型在安全关键应用中的认证部署成为可能。

关键词

引用

@article{arxiv.2602.09757,
  title  = {Towards Poisoning Robustness Certification for Natural Language Generation},
  author = {Mihnea Ghitu and Matthew Wicker},
  journal= {arXiv preprint arXiv:2602.09757},
  year   = {2026}
}