这是您的总督,如果合您意:探索混合 LLM 中的欺骗性与鲁棒性
计算与语言
2025-03-11 v1 人工智能
摘要
混合大型语言模型智能体架构通过在推理时利用多个 LLM 的协作,在 AlpacaEval 2.0 等知名基准测试上取得了最先进的性能。尽管取得了这些成功,但尚未对 MoA 的安全性和可靠性进行评估。我们提出了针对 MoA 抵抗故意提供误导性响应的欺骗性 LLM 智能体鲁棒性的首个全面研究。我们考察了欺骗性信息传播、模型规模和信息可用性等因素,并发现了关键漏洞。在 AlpacaEval 2.0 上,流行的 LLaMA 3.1-70B 模型与 3 层 MoA(6 个 LLM 智能体)结合时,实现了 49.2% 的长度控制胜率。然而,我们证明,仅向 MoA 中引入一个 经过精心指令设计的欺骗性智能体,就可以将性能降低至 37.9%,有效地抵消了所有 MoA 带来的增益。在多项选择理解任务 QuALITY 上,影响同样严重,准确率骤降了惊人的 48.5%。受旨在最小化影响和欺骗的威尼斯总督历史投票过程的部分启发,我们提出了一系列无监督防御机制,恢复了大部分丢失的性能。
引用
@article{arxiv.2503.05856,
title = {This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs},
author = {Lorenz Wolf and Sangwoong Yoon and Ilija Bogunovic},
journal= {arXiv preprint arXiv:2503.05856},
year = {2025}
}
备注
35 pages, 9 figures, 16 tables