中文

基于约束耦合推理架构的蒸馏抵抗性公开理论

人工智能 2026-03-27 v1 密码学与安全 计算机与社会 机器学习

摘要

知识蒸馏、模型提取和行为迁移已成为前沿 AI 中的核心关注议题。主要风险不仅在于复制,更在于能力可能比原附随的治理结构更廉价地被转移。本文提出一种面向公众且安全的理论框架,用于在架构层面降低这种不平衡。核心论点是:当高级能力耦合于塑造状态转移的时间内约束条件时,蒸馏作为捷径的价值就会降低。为形式化此思想,本文引入一种约束耦合推理框架,包含四个要素:受限的转移负担、路径负载累积、动态演化可行区域,以及能力-稳定性耦合条件。本文刻意公开安全:省略专有实现细节、训练配方、阈值、隐藏状态仪器、部署程序及其他保密系统设计选择。其贡献为理论层面,而非操作层面。它提供了一个可验证的架构论点、清晰的威胁模型,以及一组可用于蒸馏抵抗性、对齐与模型治理的可实验检验假设。

关键词

引用

@article{arxiv.2603.25022,
  title  = {A Public Theory of Distillation Resistance via Constraint-Coupled Reasoning Architectures},
  author = {Peng Wei and Wesley Shu},
  journal= {arXiv preprint arXiv:2603.25022},
  year   = {2026}
}