中文

面向私有大语言模型的熵引导注意力机制

机器学习 2025-01-10 v2 密码学与安全

摘要

专有语言模型的普及引发了严重的隐私关注,使得隐私推理(PI)取得进展成为必要,即在不透露用户敏感信息的前提下直接对加密数据进行计算。虽然PI提供了有前景的解决方案,但其实际部署受到显著的通信和延迟开销的阻碍,这些开销主要来自非线性运算。为解决此问题,我们引入了一个信息论框架来表征解码器-only语言模型中非线性运算的作用,为针对PI需求优化的Transformer架构提供原则性基础。通过利用香农熵作为量化度量,我们发现非线性运算的前所未有的双重意义:除了确保训练稳定性外,它们对于维护注意力头的多样性至关重要。具体而言,我们发现删除非线性运算会触发两种关键故障模式:在更深的层次上发生{\em 熵崩溃}导致训练不稳定,以及在更早的层次上发生{\em 熵过载}导致 underutilize Multi-Head Attention (MHA)的表示容量。在此基础上,我们提出了一种熵引导注意力机制,配合一种新颖的熵正则化技术来缓解熵过载问题。此外,我们探索了用于防止熵崩溃和稳定训练的PI友好型层归一化替代方案,以适应减少非线性运算的LLM。我们的研究建立了信息论与架构设计之间的鸿沟,确立了熵动力学作为开发高效PI架构的原则性指导。代码和实现均可在 https://github.com/Nandan91/entropy-guided-attention-llm 获取。

关键词

引用

@article{arxiv.2501.03489,
  title  = {Entropy-Guided Attention for Private LLMs},
  author = {Nandan Kumar Jha and Brandon Reagen},
  journal= {arXiv preprint arXiv:2501.03489},
  year   = {2025}
}

备注

Accepted to the 6th AAAI Workshop on Privacy-Preserving Artificial Intelligence (PPAI), 2025. arXiv admin note: substantial text overlap with arXiv:2410.13060