中文

SNEAK: 评估大语言模型中的策略性通信与信息泄露

计算与语言 2026-04-01 v1

摘要

大语言模型(LLM)越来越多地部署在多智能体环境中,通信需要在信息性和保密性之间取得平衡。在这种环境中,智能体可能需要向协作者发出信号,同时防止对手推断出敏感细节。然而,现有的 LLM 基准主要评估推理、事实知识或指令遵循等能力,并不直接测量非对称信息下的策略性通信。我们引入 SNEAK(Secret-aware Natural language Evaluation for Adversarial Knowledge),一个用于评估语言模型中选择性信息分享的基准。在 SNEAK 中,模型获得一个语义类别、一组候选词和一个秘密词,必须生成一条消息,表明其知晓秘密但不完全暴露它。我们使用两个具有不同信息状态的模拟智能体评估生成的消息:一个知道秘密并必须识别预期消息的盟友(ally),以及不知道秘密并试图从消息中推断它的变色龙(chameleon)。这产生了两个互补的指标:效用(utility),衡量消息与协作者通信的效果,以及泄露(leakage),衡量消息向对手揭示的信息量。通过这一框架,我们分析了现代语言模型中信息性与保密性之间的权衡,并表明在非对称信息下进行策略性通信对当前系统仍然是一个具有挑战性的能力。值得注意的是,人类参与者以大幅优势超越了所有被评估的模型,得分高达四倍。

关键词

引用

@article{arxiv.2603.29846,
  title  = {SNEAK: Evaluating Strategic Communication and Information Leakage in Large Language Models},
  author = {Adar Avsian and Larry Heck},
  journal= {arXiv preprint arXiv:2603.29846},
  year   = {2026}
}