中文

利用评估榜单分发大规模恶意模型

机器学习 2025-07-15 v1 密码学与安全

摘要

尽管对机器学习模型的投毒攻击已有大量研究,但针对如何在规模化层面分发投毒模型的机制仍然鲜有探讨。本文揭示了模型评估榜单——用于模型发现与排序的平台——如何成为攻击者进行隐蔽大规模投毒模型分发的强大渠道。我们提出了一种名为“TrojanClimb”的通用框架,使攻击者能够在保持竞争性评估榜单绩效的同时植入恶意行为。我们在四种多样化的模态上展示了其有效性,包括文本嵌入、文本生成、文本到语音和文本到图像,结果表明攻击者能够成功获得高排名,同时嵌入任意有害功能,从后门到偏见注入。我们的发现揭示了机器学习生态系统中的重大漏洞,凸显了迫切需要重新设计评估榜单机制以检测并过滤恶意(如投毒)模型的紧迫性,也暴露了就机器学习社区在采纳来自未验证来源模型时的安全风险。

关键词

引用

@article{arxiv.2507.08983,
  title  = {Exploiting Leaderboards for Large-Scale Distribution of Malicious Models},
  author = {Anshuman Suri and Harsh Chaudhari and Yuefeng Peng and Ali Naseh and Amir Houmansadr and Alina Oprea},
  journal= {arXiv preprint arXiv:2507.08983},
  year   = {2025}
}