中文

基于 PID 控制的自愈机制以提升大型语言模型的鲁棒性

计算与语言 2024-04-02 v1

摘要

尽管深度神经网络在众多自然语言处理应用中非常有效,但最近的发现暴露了这些语言模型在引入微小扰动时的脆弱性。这些扰动在人类看来在语义上无法区分,但可以显著降低训练良好的语言模型的性能,引发了对在安全关键情况下部署其可靠性的担忧。在这项工作中,我们构建了一个计算高效的自愈过程,以在输入数据受到扰动时纠正在线推理过程中不期望的模型行为。这被表述为一个轨迹优化问题,其中神经网络层的内部状态使用 PID(比例-积分-微分)控制机制自动纠正。P 控制器针对即时状态调整,而 I 和 D 控制器分别考虑过去状态和未来动态趋势。我们利用训练数据的几何特性来设计有效的线性 PID 控制器。这种方法将计算成本降低到仅使用 P 控制器的水平,而不是完整的 PID 控制。此外,我们引入了一种解析方法来近似最优控制解,增强了该受控系统的实时推理能力。而且,我们在简化设置中对解析解进行了理论误差分析。所提出的基于 PID 控制的自愈是一个低成本的框架,可提高预训练大型语言模型(无论是标准训练还是鲁棒训练)对各种扰动的鲁棒性。详细实现可在:https://github.com/zhuotongchen/PID-Control-Based-Self-Healing-to-Improve-the-Robustness-of-Large-Language-Models 中找到。

关键词

引用

@article{arxiv.2404.00828,
  title  = {PID Control-Based Self-Healing to Improve the Robustness of Large Language Models},
  author = {Zhuotong Chen and Zihu Wang and Yifan Yang and Qianxiao Li and Zheng Zhang},
  journal= {arXiv preprint arXiv:2404.00828},
  year   = {2024}
}

备注

Transactions on Machine Learning Research