缸中之脑:智能体沙盒与可解释性的高效世界建模的基本极限
人工智能
2025-04-08 v1 系统与控制
系统与控制
摘要
最近的工作提出使用世界模型生成受控虚拟环境,在其中AI智能体可以在部署前进行测试,以确保其可靠性和安全性。然而,准确的世界模型通常具有很高的计算需求,这可能会严重限制此类评估的范围和深度。受经典“缸中之脑”思想实验的启发,本文研究了简化世界模型的方法,这些方法对正在评估的AI智能体保持不可知性。通过遵循计算力学的原理,我们的方法揭示了世界模型构建中效率与可解释性之间的基本权衡,表明没有任何单一世界模型能够优化所有期望的特性。基于这一权衡,我们确定了构建世界模型的过程,这些模型要么最小化内存需求,划定可学习内容的边界,要么允许追踪不良结果的原因。通过这样做,这项工作确立了世界建模的基本极限,从而产生了可操作的指导方针,为与有效智能体评估相关的核心设计选择提供信息。
引用
@article{arxiv.2504.04608,
title = {AI in a vat: Fundamental limits of efficient world modelling for agent sandboxing and interpretability},
author = {Fernando Rosas and Alexander Boyd and Manuel Baltieri},
journal= {arXiv preprint arXiv:2504.04608},
year = {2025}
}
备注
38 pages, 5 figures