中文

大语言模型中的规则编码与合规性:一种信息论分析

人工智能 2025-10-10 v2

摘要

基于大语言模型(LLM)的安全关键型智能体的设计远不止简单地进行提示工程。本文对系统提示中规则编码如何影响注意力机制和合规行为进行了全面的信息论分析。我们展示,语法熵值低且锚点高度集中化的规则格式会降低注意力熵值并提高指针保真度,但揭示了锚点冗余性与注意力熵值之间存在的根本性权衡,这一前人工作未能识别。通过对包括因果注意力、双向注意力、局部稀疏注意力、核化注意力和跨注意力机制的正式分析,我们建立了指针保真度的下界,并展示了锚点放置策略必须如何在保真度与熵值目标之间进行权衡。将这些见解与动态规则验证架构结合,我们提供了一个形式证明,表明热重载经验证的规则集会增加合规输出的渐进概率。这些发现凸显了原则性锚点设计和双重强制机制的必要性,以保护LLM基于智能体免受提示注入攻击,同时在不断演变的领域中维持合规性。

关键词

引用

@article{arxiv.2510.05106,
  title  = {Rule Encoding and Compliance in Large Language Models: An Information-Theoretic Analysis},
  author = {Joachim Diederich},
  journal= {arXiv preprint arXiv:2510.05106},
  year   = {2025}
}