中文

EXHIB:野外函数相似性真实且多样的评估基准

密码学与安全 2026-04-03 v1 机器学习 软件工程

摘要

二进制函数相似性检测(BFSD)是软件安全的核心问题,支持漏洞分析、恶意软件分类和补丁源代码追溯等任务。过去数十年间,众多模型和工具已被开发用于此应用;然而,由于缺乏该领域的全面性通用基准,研究人员在有效比较不同模型时面临困难。现有数据集范围有限,常仅聚焦于特定变换或类型的二进制文件,无法反映真实世界应用的全面多样性。我们引入EXHIB,一个来自野外收集的包含五个真实数据集的基准,每个数据集都突显BFSD问题空间的不同方面。我们在EXHIB上评估了9个代表性模型,涵盖多个BFSD范式,观察到在固件和语义数据集上与标准设置相比性能下降最高可达30%,揭示了显著的泛化差距。我们的结果表明,针对低级和中级二进制变异的鲁棒性并不泛化到高级语义差异,凸显当前BFSD评估实践中的一个关键盲点。

关键词

引用

@article{arxiv.2604.01554,
  title  = {EXHIB: A Benchmark for Realistic and Diverse Evaluation of Function Similarity in the Wild},
  author = {Yiming Fan and Jun Yeon Won and Ding Zhu and Melih Sirlanci and Mahdi Khalili and Carter Yagemann},
  journal= {arXiv preprint arXiv:2604.01554},
  year   = {2026}
}

备注

13 pages, 7 figures. This is a technical report for the EXHIB benchmark. Code and data are available at https://github.com/fan1192/bfsd-anon-artifact