中文

EmbodiedGovBench:用于具身智能体系统治理、恢复与升级安全的基准测试

机器人学 2026-04-14 v1 人工智能

摘要

近期的具身人工智能进展催生了机器人策略、基础模型和模块化运行时环境日益增长的生态系统。然而,当前的评估仍以任务成功指标(如完成率或操控精度)为主导,这些指标留下了一个关键缺口:它们不衡量具身系统是否具有可治理性——即是否尊重能力边界、执行政策、安全恢复、维护审计轨迹并响应人类监督。我们提出了EmbodiedGovBench,这是一个针对具身智能体系统治理导向评估的基准测试。不同于仅询问机器人能否完成任务,EmbodiedGovBench评估系统在现实扰动下是否保持可控性、政策约束性、可恢复性、可审计性和演化安全性。该基准测试涵盖七个治理维度:未授权能力调用、运行漂移鲁棒性、恢复成功率、政策可移植性、版本升级安全性、人工干预响应性和审计完整性。我们定义了覆盖单机器人和编队场景的基准结构,包含情景模板、扰动算子、治理指标以及基线评估协议。我们描述了如何在具身能力运行时以模块化接口和合同感知的升级工作流程中实例化该基准测试。我们的分析表明,具身治理应成为首要的评估目标。EmbodiedGovBench为这一转变提供了初始的测量框架。

关键词

引用

@article{arxiv.2604.11174,
  title  = {EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems},
  author = {Xue Qin and Simin Luan and John See and Cong Yang and Zhijun Li},
  journal= {arXiv preprint arXiv:2604.11174},
  year   = {2026}
}

备注

34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench