中文

Factor(U,T): 通过监控计划控制不受信任的 AI

密码学与安全 2025-12-18 v1 人工智能

摘要

随着 AI 能力的不断提升,我们越来越依赖强大模型来分解复杂任务——但如果分解器本身是恶意的呢? factored认知协议将复杂任务分解为更简单的子任务:一个模型创建分解,而其他模型在孤立环境中实现子任务。以往的工作使用受信任(较弱但可靠)的模型进行分解,这限制了在分解本身具有挑战性的任务中实用的范围。我们引入Factor(U,T),其中不受信任(更强但可能是恶意的)模型进行分解,而受信任模型实现子任务。当仅观察自然语言任务指令而非完整解决方案时,监控器能否检测到恶意活动?我们在BigCodeBench上的控制评估中对Factor(U,T)进行基准测试和红队测试。仅通过自然语言任务指令进行区分恶意与诚实分解的监控器表现较差(AUROC 0.52),而评估完整Python解决方案的监控器表现优异(AUROC 0.96)。此外,Factor(D,U),使用受信任分解器并监控具体子解决方案,实现了卓越的区分度(AUROC 0.96)和强大的安全性(1.2% ASR),表明实现上下文监控在分解-only监控失败的情况下成功。

关键词

引用

@article{arxiv.2512.14745,
  title  = {Factor(U,T): Controlling Untrusted AI by Monitoring their Plans},
  author = {Edward Lue Chee Lip and Anthony Channg and Diana Kim and Aaron Sandoval and Kevin Zhu},
  journal= {arXiv preprint arXiv:2512.14745},
  year   = {2025}
}

备注

Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent). 6 pages body, 8 pages total, 3 figures