中文

驯服 AI 机器人:大语言模型中神经状态的可控性

人工智能 2023-05-31 v1 计算与语言 机器学习 系统与控制 系统与控制

摘要

我们探讨一个主体是否能通过合适地选择提示,将 AI 机器人控制到任意状态。为此,我们首先引入一个便于分析的“意义(meaning)”的形式化定义。接着,我们刻画了大型语言模型(LLMs)显然所训练的“有意义数据”,以及通过当今 LLMs 大体满足的条件所定义的“训练良好的 LLMs”。虽然训练良好的 LLM 构建了一个欧几里得的意义嵌入空间,但意义本身并不构成向量(线性)子空间,而是其中的一个商空间。我们随后刻画了对于某个输入提示可由 LLM 状态达到的意义子集,并表明训练良好的机器人虽概率较小但可达到任意意义。我们接着引入一种更强的可控性概念,即“几乎必然可达性(almost certain reachability)”,并表明当限制于意义空间时,AI 机器人是可控的。我们在引入注意力 AI 机器人的函数刻画后做到这一点,并最终推导出可控性的充要条件。AI 机器人可控意味着对手可将其引向任意状态。然而,采样过程可被设计用以抵消不利行为,并在跨越不良状态空间区域边界前避免到达这些区域。

关键词

引用

@article{arxiv.2305.18449,
  title  = {Taming AI Bots: Controllability of Neural States in Large Language Models},
  author = {Stefano Soatto and Paulo Tabuada and Pratik Chaudhari and Tian Yu Liu},
  journal= {arXiv preprint arXiv:2305.18449},
  year   = {2023}
}

备注

TLDR: AI Bots are stochastic dynamical systems whose mental state can be controlled by both the user and the designer. The space of meanings, defined as equivalence classes of sentences, is learned during fine-tuning with human supervision, and safeguarding can be designed into the bot by establishing controls both at its input and output