可信且可事务化的自主代理系统 SAFEFLOW 协议
人工智能
2025-06-12 v3 计算与语言
摘要
近期大语言模型(LLM)和视觉语言模型(VLM)的进展使强大的数据主动代理能够进行复杂推理和多模态工具使用。尽管其能力日益增强,当今的代理框架仍脆弱,缺乏针对安全信息流、可靠性和多代理协调的原则机制。本文引入 SAFEFLOW,一个面向构建可信赖的 LLM/VLM 代理的新型协议级框架。SAFEFLOW 强制执行细粒度信息流控制(IFC),精确跟踪所有在代理、工具、用户和环境之间交换数据的来源、完整性和保密性。通过约束 LLM 推理遵守这些安全标签,SAFEFLOW 可防止不可信或对抗性输入污染高完整性决策。为确保在并发多代理环境中的鲁棒性,SAFEFLOW 引入事务执行、冲突解决和对共享状态的安全调度,保持跨代理的全局一致性。我们进一步引入包括写前日志、回滚和安全缓存在内的机制,进一步增强了对运行时错误和策略违规的韧性。为验证性能,我们构建了 SAFEFLOWBENCH,一个综合性基准套件,旨在评估代理在对抗、噪声和并发操作条件下的可靠性。大量实验表明,即使在敌对环境中,采用 SAFEFLOW 构建的代理仍能保持出色的任务性能和安全保证,显著优于最先进的水平。SAFEFLOW 和 SAFEFLOWBENCH 为原则性、稳健和安全的代理生态系统奠定了基础,推动了可靠自主性的前沿发展。
引用
@article{arxiv.2506.07564,
title = {SAFEFLOW: A Principled Protocol for Trustworthy and Transactional Autonomous Agent Systems},
author = {Peiran Li and Xinkai Zou and Zhuohang Wu and Ruifeng Li and Shuo Xing and Hanwen Zheng and Zhikai Hu and Yuping Wang and Haoxi Li and Qin Yuan and Yingmo Zhang and Zhengzhong Tu},
journal= {arXiv preprint arXiv:2506.07564},
year = {2025}
}
备注
Former versions either contain unrelated content or cannot be properly converted to PDF