中文

骗取我如果可以:对二元代码相似性检测模型抗语义保护变换的鲁棒性研究

密码学与安全 2026-02-16 v1 机器学习

摘要

二进制代码分析在网络安全中发挥 essential 作用,促进了在缺乏源代码的情况下进行逆向工程以揭示程序内部工作方式。传统方法,如静态和动态分析,从被剥离的二进制文件中提取有价值的见解,但往往需要大量专业知识和手动工作。近期深度学习技术的进展为增强二进制分析提供了前景的机会,通过捕获潜在特征并披露底层代码语义。尽管基于机器学习的二进制分析模型数量不断增长,但其对抗代码变换在二进制层面的鲁棒性仍未得到充分探讨。我们评估了针对二元代码相似性检测(BCSD)任务的深度学习模型在语义保护变换下的鲁棒性。独特的机器指令特性为与其他领域典型输入扰动的挑战提供了distinct 限制。我们引入 asmFooler 系统,通过多样化的对抗代码变换评估 BCSD 模型的抗性。我们通过在六个代表性 BCSD 模型上应用八种语义保护变换,从 620 个基线样本构建了 9,565 个二进制变体数据集。我们的主要发现凸显了几个关键见解:i)模型鲁棒性取决于处理管道,包括代码预处理、架构和特征选择;ii)对抗变换的有效性受限于由模型特定约束(如输入大小和指令表达容量)形成的预算;iii)精心设计的变换即使在最小扰动下也能高度有效;iv)此类变换通过聚焦于语义上重要的指令,高效地干扰模型决策(例如误导为误报或漏报)。

关键词

引用

@article{arxiv.2602.12681,
  title  = {Fool Me If You Can: On the Robustness of Binary Code Similarity Detection Models against Semantics-preserving Transformations},
  author = {Jiyong Uhm and Minseok Kim and Michalis Polychronakis and Hyungjoon Koo},
  journal= {arXiv preprint arXiv:2602.12681},
  year   = {2026}
}

备注

23 pages, 9 figures, 5 tables. The paper has been accepted by The ACM International Conference on the Foundations of Software Engineering (FSE 2026)