中文

WebGuard++:基于 HTML 子图双向融合和多尺度卷积 BERT 的可解释恶意 URL 检测

密码学与安全 2025-06-25 v1 机器学习

摘要

URL+HTML 特征融合在鲁棒的恶意 URL 检测中显示出前景,因为攻击者特征会持续存在于 DOM 结构中。然而,现有方法存在四个关键不足:(1) URL 模型不完整,未能同时捕获词汇模式和语义上下文;(2) HTML 图稀疏,威胁相关节点(如混淆脚本)在良性内容中被孤立,导致图聚合时信号被稀释;(3) 单向分析,忽略了 URL 与 HTML 特征的双向相互作用;(4) 决策不透明,缺乏对恶意 DOM 组件的归因。为解决这些挑战,我们提出了 WebGuard++,包含 4 个新组件:1) 跨尺度 URL 编码器:基于 Transformer 网络与动态卷积,层次学习从局部到全局、从粗到细的 URL 特征;2) 子图感知 HTML 编码器:将 DOM 图分解为可解释的子结构,通过层次特征融合放大稀疏威胁信号;3) 双向耦合模块:通过跨模态对比学习对齐 URL 与 HTML 嵌入,优化跨模态一致性和同模态特异性;4) 投票模块:通过恶意子图预测的共识投票定位恶意区域。实验表明,WebGuard++ 在两个数据集上相比最先进的基线方法实现了显著提升,在固定 FPR 为 0.001 和 0.0001 时,TPR 提升 1.1 倍至 7.9 倍。

关键词

引用

@article{arxiv.2506.19356,
  title  = {WebGuard++:Interpretable Malicious URL Detection via Bidirectional Fusion of HTML Subgraphs and Multi-Scale Convolutional BERT},
  author = {Ye Tian and Zhang Yumin and Yifan Jia and Jianguo Sun and Yanbin Wang},
  journal= {arXiv preprint arXiv:2506.19356},
  year   = {2025}
}