AgentGuard:基于混合搜索与元数据-内容融合的多智能体框架用于鲁棒的包混淆检测
软件工程
2026-04-21 v1 密码学与安全
摘要
开源软件(OSS)的普及使软件供应链成为诸如包混淆等攻击的主要目标,这类攻击通过发布名称与合法包 deceptively similar 的恶意包来实施。为保护此类攻击并确保 OSS 使用,已提出多种混淆检测方法。然而,现有方法局限于单一信号检索策略(仅依赖词汇或语义指标),难以控制高误报率(FPR),且易受对抗性规避。关键的是,作为基于内容中立的方法,它们根本无法区分命名高度相似但代码相似性低的良性包与恶意包,从而导致持续的高 FPR。为克服这些限制,我们引入 AgentGuard,一个 novel 多智能体框架用于包混淆检测。具体而言,它首先使用微调词嵌入模型进行混合相似性搜索发现潜在混淆目标。随后,它通过融合机器学习模型评估风险,该模型独特地结合:(1)多维度元数据组和(2) novel 包内容分析组,以降低 FPR 并减轻对抗性规避的影响。为评估 AgentGuard 的有效性,我们在具有挑战性的 ConfuDB 和 NeupaneDB 数据集上进行评估。我们的结果表明,AgentGuard 显著优于 state-of-the-art 基准(ConfuGuard 和 Typomind),在精度提升 12%~49% 的同时将 FPR 降低 11%~35%,并有效发现被混淆的包。
引用
@article{arxiv.2604.16309,
title = {AgentGuard: A Multi-Agent Framework for Robust Package Confusion Detection via Hybrid Search and Metadata-Content Fusion},
author = {Yu Li and Wei Ma and Zhi Chen and Ye Liu and Lingxiao Jiang and Junyi Tao and Hao Liu and Yongqiang Lyu and Qiang Hu},
journal= {arXiv preprint arXiv:2604.16309},
year = {2026}
}