ShieldedCode:面向受保护代码的鲁棒表示学习
计算与语言
2026-01-29 v1
摘要
大型语言模型(LLM)在代码生成方面取得了显著进展,但其在软件保护方面的潜能尚未得到充分发挥。逆向工程持续威胁软件安全,而传统的虚拟机保护(VMP)依赖刚性的基于规则的转换,设计成本高昂且易受自动化分析攻击。本文提出了首个面向 VMP 受保护代码的保护感知框架,学习其鲁棒表示。我们构建大规模的源代码与标准化 VM 实现配对数据集,并在指令级、前置指令级和指令间层引入层次化依赖建模。我们联合优化语言建模与功能感知和保护感知对比目标,以捕获语义等效性和保护强度。为进一步评估韧性,我们提出了一种保护有效性优化任务,用于量化和排序来自同一源代码的不同 VM 变体。结合两阶段持续预训练和微调管道,我们的方法使模型能够生成、比较和推理受保护代码。大量实验表明,我们的框架在不同保护水平上显著提升鲁棒性,为基于学习的软件防御开辟了新的研究方向。
引用
@article{arxiv.2601.20679,
title = {ShieldedCode: Learning Robust Representations for Virtual Machine Protected Code},
author = {Mingqiao Mo and Yunlong Tan and Hao Zhang and Heng Zhang and Yangfan He},
journal= {arXiv preprint arXiv:2601.20679},
year = {2026}
}
备注
Accepted to ICLR 2026