中文

POLAR-Bench:面向LLM代理隐私-效用权衡诊断基准

人工智能 2026-05-20 v1

摘要

LLM代理日益获取用户私有数据,并在与第三方系统交互时代表用户行动。用户定义可能或必须共享的内容,代理必须即使在第三方系统行为恶意时,也能稳健遵循该意图。我们引入POLAR-Bench(面向策略感知的对抗基准),其中由信任模型(具备隐私政策和任务)与第三方模型对话,后者会恶意探测任务相关和受保护属性。跨10个领域、7852个样本,我们通过确定性集合成员资格对隐私和效用进行评分,并沿两个正交轴变动隐私政策维度和攻击策略,为每个模型生成5×5诊断表。我们的结果揭示了一个明显的分界:当前前沿模型会保护超过99%的受保护属性,而规模为1-30B的较小开源模型(用户最常在本地运行或通过私有推理的代理),则表现明显较差,其中最弱的模型会泄露超过一半。POLAR-Bench因此定位了每个模型意图遵循的薄弱环节,为其最关键之处提供了隐私对齐的托脚。

关键词

引用

@article{arxiv.2605.19127,
  title  = {POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents},
  author = {Qiaoyuan Zheng and Yiqu Yang and Qi Gao and Imanol Schlag},
  journal= {arXiv preprint arXiv:2605.19127},
  year   = {2026}
}

备注

Preprint