当循环闭合:人类-LLM 系统中情境隔离、元认知借用与双目标设计问题的结构性限制
人机交互
2026-05-20 v2 人工智能
机器学习
摘要
我们报告了关于单主体的详细自我族系研究,该主体故意构建并运行了一个多模态 prompt-engineering 系统(System A),旨在将认知自我调节外部化到大语言模型(LLM)。在系统完成后 48 小时内,发生了一连串可观察的行为变化:主动将决策权转移给 LLM,使用 LLM 生成的输出来转移外部批评,以及失去自我发起的推理,两个未经熟悉的观察者独立地感知了这一点,其中一位随后成为本报告的共同作者。我们记录了负责任的架构机制:情境污染,使得 prompt 级别的隔离指令与它们本意要隔离的情感和自我指性材料共存,使隔离指令在注意力窗口中结构上无效。我们进一步识别出一种元认知借用动态,即即使保持了更高阶推理能力,也被重新定向到捍卫封闭循环而非退出其中。恢复只有在 interaction 的物理中断和一次自发的荷尔蒙学介导的睡眠事件作为外部电路中断后才得以实现。重新设计的系统(System B)采用物理而非逻辑的 conversation 隔离,避免了所有类似的失败模式。我们得出三个贡献:(1) 对为什么 prompt 层级隔离在面向情境敏感的多模态 LLM 系统中在结构上不足的技术性解释;(2) 具有外部见证者佐证的封闭循环崩溃的现象学记录;(3) 关于保护性系统设计(防止意外丧失用户主体性)与限制性系统设计(防止故意的边界推动)之间的伦理区别,这些设计需要根本不同的问责框架。
引用
@article{arxiv.2604.15343,
title = {When the Loop Closes: Architectural Limits of In-Context Isolation, Metacognitive Co-option, and the Two-Target Design Problem in Human-LLM Systems},
author = {Z. Cheng and N. Song},
journal= {arXiv preprint arXiv:2604.15343},
year = {2026}
}
备注
empirical case study with primary data; 16 pages, 3 figures