源代码基础模型是可迁移的二进制分析知识库
软件工程
2024-11-22 v2 人工智能
计算与语言
摘要
面向人类的二进制逆向工程(HOBRE)位于二进制和源代码的交叉点,旨在将二进制代码提升为与源代码相关的人类可读内容,从而弥合二进制-源代码语义鸿沟。最近在单模态代码模型预训练方面的进展,特别是在生成式源代码基础模型(SCFMs)和二进制理解模型方面,为适用于HOBRE的迁移学习奠定了基础。然而,现有的HOBRE方法严重依赖单模态模型(如SCFMs)进行监督微调或通用LLMs进行提示,导致性能次优。受大型多模态模型最新进展的启发,我们提出可以利用来自两边的单模态代码模型的优势来有效弥合语义鸿沟。在本文中,我们介绍了一种新颖的探测-恢复框架,该框架包含一个二进制-源代码编码器-解码器模型和黑盒LLMs用于二进制分析。我们的方法利用SCFMs中预训练的知识来合成相关的、符号丰富的代码片段作为上下文。这种额外的上下文使黑盒LLMs能够提高恢复准确性。我们在零样本二进制摘要和二进制函数名恢复方面展示了显著改进,在CHRF上相对提升10.3%,在基于GPT4的摘要指标上相对提升16.7%,在令牌级精确率和召回率上分别绝对提升6.7%和7.4%。这些结果突显了我们的方法在自动化和改进二进制代码分析方面的有效性。
引用
@article{arxiv.2405.19581,
title = {Source Code Foundation Models are Transferable Binary Analysis Knowledge Bases},
author = {Zian Su and Xiangzhe Xu and Ziyang Huang and Kaiyuan Zhang and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2405.19581},
year = {2024}
}