中文

面向不稳定测试检测与分类的 LLM 微调与少样本学习分析

软件工程 2025-02-06 v1 人工智能

摘要

不稳定测试在执行过程中表现出非确定性行为,它们可能在受测程序未发生任何更改的情况下通过或失败。检测和分类这些不稳定测试对于维护自动化测试套件的鲁棒性以及确保测试的整体可靠性和信心至关重要。然而,由于测试行为的可变性(可能取决于环境条件和细微的代码交互),不稳定测试的检测与分类颇具挑战性。大语言模型(LLM)为解决这一挑战提供了有前景的方法,其中微调和少样本学习(FSL)成为可行的技术。拥有足够数据时,微调预训练的 LLM 可以实现高精度,使其适用于资源更丰富的组织。另外,我们引入了 FlakyXbert,这是一种采用孪生网络架构以在有限数据下高效训练的 FSL 方法。为了理解这两种方法在性能和成本上的差异,我们比较了在较大数据集上的微调与在较小数据集受限场景下的 FSL。我们的评估涉及两个现有的不稳定测试数据集:FlakyCat 和 IDoFT。结果表明,虽然微调可以达到高精度,但 FSL 提供了一种具有竞争性精度的成本效益方法,这对于训练历史数据有限的组织或项目尤其有利。这些发现强调了微调和 FSL 在不稳定测试检测与分类中的可行性,各自适用于不同的组织需求和资源可用性。

关键词

引用

@article{arxiv.2502.02715,
  title  = {An Analysis of LLM Fine-Tuning and Few-Shot Learning for Flaky Test Detection and Classification},
  author = {Riddhi More and Jeremy S. Bradbury},
  journal= {arXiv preprint arXiv:2502.02715},
  year   = {2025}
}

备注

10 pages