中文

基于真实值评估的程序剥减技术复盘

计算与语言 2026-04-21 v1 人工智能 机器学习

摘要

程序剥减旨在移除未使用代码,以减少性能开销、攻击面和维护成本。尽管剥减技术在容器、库和应用程序等多个层面不断演进,但每一层面都在构建应用程序级剥减的原则之上。尽管如此,应用程序级剥减仍依赖于不完美的代理来衡量性能,如基于测试用例的评估判断正确性、代码规模衡量运行时效率、积木计数减少用于估算安全姿态。尽管社区对此类不完美代理存在广泛怀疑,但仍缺乏标准化的方法或基准来评估应用程序级软件剥减的真实性能。本经验论文旨在弥合这一差距。我们通过基于真实值的评估范式重新审视了应用程序级剥减的基础。对八款最先进剥减工具 (Blade、Chisel、Cov、CovA、Lmcas、Trimmer、Occam、Razor) 的分析揭示了通过传统评估方法难以获取的见解。这些工具在源代码到源代码、IR 到 IR 和二进制到二进制转换范式中呈现完整谱系,跨抽象层级进行整体性重新评估。我们的分析表明,动态分析驱动的工具往往会移除最高达 94% 应保留的代码,静态分析方法则表现相反,表现出高假阳性保留率,因粗粒度依赖近似过度。此外,静态分析可能通过引入函数的专用变体来添加代码。假阳性保留与移除不仅导致功能错误,还可能导致系统性不一致、鲁棒性失效和可被利用的漏洞。

关键词

引用

@article{arxiv.2604.17716,
  title  = {Concurrent Criterion Validation of a Validity Screen for LLM Confidence Signals via Selective Prediction},
  author = {Jon-Paul Cacioli},
  journal= {arXiv preprint arXiv:2604.17716},
  year   = {2026}
}

备注

11 pages, 4 figures, 2 tables. Companion to arXiv:2604.15702