中文

模型不稳定性是需容忍的噪声还是可管理的属性?

软件工程 2026-07-11 v1 机器学习

摘要

在软件分析中,重复运行相同的分析通常会得到不同的模型和结论。这降低了对模型的信任并限制了其使用。我们发现模型不稳定性是一个主要问题。在 127 个多目标 SE 优化问题(12,700 个测试用例)中,即使采用改进的设置,最先进的优化器的重复运行也仅在 13.7% 的测试用例上达成一致。我们认为这种不稳定性不仅仅是需要容忍的噪声,而是一种可以测量和管理的属性。通过调整标签的分配方式、模型的复杂程度以及分割的评分方式,我们获得的模型在默认配置下的一致性提高了 4.8 倍。优化误差的标准差平均下降 22%(平均标准差从 17.4 降至 13.6),而推荐质量则有所提高而非下降。在质量方面,精炼设置在 127 个数据集中的 119 个上在统计上排名第一,而默认设置仅为 74 个。然后,我们测试了因果和数据局部性干预措施,发现它们仅部分有效,表明存在残余的稳定性下限。我们的证据表明,数据本身(噪声、稀缺标签、代理目标以及数据集允许的许多近似等效模型)设定了稳定性的基本限制。我们得出结论,不稳定性应被视为 SE 优化中的标准评估轴,应常规测量、与性能一起报告,并用于校准对任何单次运行的信任。本文中的方法为未来减少 SBSE 不稳定性的努力提供了一个可以评判的基线。为支持开放科学,我们提供以下复现包:https://tinyurl.com/Model-Instability

关键词

引用

@article{arxiv.2607.10420,
  title  = {Is Model Instability just Noise to be Tolerated or a Property that can be Managed?},
  author = {Amirali Rayegan and Lunxiao Li and Tim Menzies},
  journal= {arXiv preprint arXiv:2607.10420},
  year   = {2026}
}