众所争议的系统中的恶意贡献测量与缓解:面向模型协作
计算与语言
2026-02-06 v1
摘要
语言模型 (LM) 越来越多地用于协作:由不同方训练的多个语言模型通过路由系统、多智能体辩论、模型合并等方式进行协作。这种去中心化范式中仍存在关键安全风险:如果多 LLM 系统中的一些模型被篡改或恶意,后果如何?我们首先通过工程化四类恶意语言模型,将其植入四种流行的模型协作系统中,并在 10 个数据集上评估受损系统。我们发现,恶意模型对多 LLM 系统具有严重影响,尤其在推理和安全领域,平均性能下降 7.12% 和 7.94%。随后我们提出缓解策略,通过采用外部监督者来监督模型协作,从而禁用/掩码这些模型以降低其影响。在平均情况下,这些策略能恢复 95.31% 的初始性能,而让模型协作系统完全抗拒恶意模型仍是开放的研究问题。
引用
@article{arxiv.2602.05176,
title = {Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems},
author = {Ziyuan Yang and Wenxuan Ding and Shangbin Feng and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2602.05176},
year = {2026}
}
备注
19 pages, 15 tables, 4 figures