中文

基于程序归一化的鲁棒且准确的源代码作者归属

机器学习 2022-03-01 v3 密码学与安全 机器学习

摘要

得益于深度学习的快速发展,源代码归属方法已取得了显著的准确率。然而,近期研究揭示了它们对对抗攻击的脆弱性。具体而言,试图伪造另一作者或掩盖原始作者的对手可以轻易欺骗它们。为解决这些新出现的问题,我们将这一安全挑战形式化为一个通用的威胁模型——关系对手(relational adversary),该模型允许对任意数量的保持语义的变换以任意问题空间作用于输入。我们的理论研究深入展示了鲁棒性的条件以及鲁棒性与准确性之间的权衡。受这些见解启发,我们提出了一种新颖的学习框架——归一化并预测(normalize-and-predict, N&P),该框架在理论上保证任意作者归属方法的鲁棒性。我们对N&P进行了广泛评估,以防御两种最新的作者归属方法免受最先进的攻击方法侵害。我们的评估表明,相较于原始模型,N&P在对抗输入上的准确率提高了多达70%。更重要的是,N&P还将鲁棒准确率提升至比对抗训练高45%,同时运行速度快逾40倍。

关键词

引用

@article{arxiv.2007.00772,
  title  = {Robust and Accurate Authorship Attribution via Program Normalization},
  author = {Yizhen Wang and Mohannad Alhanahnah and Ke Wang and Mihai Christodorescu and Somesh Jha},
  journal= {arXiv preprint arXiv:2007.00772},
  year   = {2022}
}