便利变为风险:托宿主行为代理中语义不确定性的观点
密码学与安全
2026-03-24 v1 人工智能
摘要
托宿主行为代理承诺了一种便利的交互模型,即用户指定目标,系统决定如何实现这些目标。我们认为,这种便利性引入了一种独特的安全问题:目标指定中的语义不确定性。用户指令通常以目标为导向,却常常不充分指定过程约束、安全边界、持久性和暴露范围。因此,代理必须在行动前完成对缺失执行语义的补全,而这种补全即使在用户陈述目标良好时,也可能产生风险的宿主端计划。本文中,我们构建了语义威胁模型,提出了语义引发的风险补全模式分类,through an OpenClaw 中心的案例研究和执行轨迹分析。我们进一步推导出防御设计原则,以明确执行边界并约束风险补全。这些发现表明,保护托宿主行为代理不仅需要控制执行时的哪些动作被允许,还需要控制如何将仅含目标的指令转化为可执行计划。
引用
@article{arxiv.2603.21231,
title = {When Convenience Becomes Risk: A Semantic View of Under-Specification in Host-Acting Agents},
author = {Di Lu and Yongzhi Liao and Xutong Mu and Lele Zheng and Ke Cheng and Xuewen Dong and Yulong Shen and Jianfeng Ma},
journal= {arXiv preprint arXiv:2603.21231},
year = {2026}
}