中文

HarmonyGuard:面向网页智能体的安全性与实用性通过自适应策略增强与双目标优化

计算与语言 2025-08-07 v1 人工智能

摘要

大型语言模型使智能体能够在开放的网页环境中自主执行任务。然而,随着网页内隐藏威胁的演变,网页智能体在长序列操作过程中面临在性能与新兴风险之间进行权衡的挑战。尽管这一挑战至关重要,但当前研究仅限于单目标优化或单轮情景,缺乏在网页环境中协同优化安全性与实用性的能力。为此,我们提出了HarmonyGuard,一个基于策略增强与目标优化的多智能体协作框架,用于联合提升实用性与安全性。HarmonyGuard具有两种基本能力:(1)自适应策略增强:我们在HarmonyGuard中引入策略智能体,该智能体自动从非结构化外部文档中提取并维护结构化安全策略,并持续更新以应对不断演变的威胁。(2)双目标优化:基于安全性与实用性的双重目标,集成于HarmonyGuard中的实用智能体执行马尔可夫式实时推理,以评估目标并利用元认知能力进行优化。大量基准测试表明,HarmonyGuard在多个基准测试上的表现优异,政策合规性提升最高可达38%,任务完成率提升最高可达20%,且在所有任务中实现超过90%的政策合规性。我们的项目已公开:https://github.com/YurunChen/HarmonyGuard。

关键词

引用

@article{arxiv.2508.04010,
  title  = {HarmonyGuard: Toward Safety and Utility in Web Agents via Adaptive Policy Enhancement and Dual-Objective Optimization},
  author = {Yurun Chen and Xavier Hu and Yuhan Liu and Keting Yin and Juncheng Li and Zhuosheng Zhang and Shengyu Zhang},
  journal= {arXiv preprint arXiv:2508.04010},
  year   = {2025}
}