LLMShot:利用 LLM 减少快照测试的维护工作
软件工程
2025-07-25 v2
摘要
快照测试已成为现代软件开发中 UI 验证的关键技术,但由于频繁的 UI 更改导致测试失败,需要手动检查以区分真正的回归和有意的设计更改,从而产生巨大的维护负担。随着应用程序的演化,这一手动三角剖过程变得日益繁重,亟需自动化分析解决方案。本文介绍了 LLMShot,一种新型框架,利用视觉语言模型(VLM)通过语义分类自动分析快照测试失败。为评估 LLMShot 的效果,我们开发了一个包含丰富功能的 iOS 应用程序的全面数据集,创建了产生真实快照差异的情景,代表真实开发工作流程。我们的评估使用 Gemma3 模型显示出强大的分类性能,12B 变体在识别失败根本原因方面召回率超过 84%,而 4B 模型在持续集成环境中提供了实际的部署优势且性能可接受。然而,我们对选择性忽略机制的探索揭示了当前基于提示的可控视觉推理方法的显著局限性。LLMShot 是自动语义快照测试分析的首个方法,为开发人员提供结构化见解,可显著减少手动三角剖工作,推动更智能的 UI 测试范式。
引用
@article{arxiv.2507.10062,
title = {LLMShot: Reducing snapshot testing maintenance via LLMs},
author = {Ergün Batuhan Kaynak and Mayasah Lami and Sahand Moslemi and Anil Koyuncu},
journal= {arXiv preprint arXiv:2507.10062},
year = {2025}
}
备注
Accepted to ICSME 2025