RUM:基于规则与大语言模型的测试技能全面评估
软件工程
2025-08-19 v1
摘要
过去八年来,META 方法一直作为国家大学学生软件测试大赛中多维度测试技能评估系统,成功评估了超过 10 万名学生的测试技能。然而,META 方法主要局限于对测试脚本的客观评估,缺乏对测试用例和测试报告等主观方面的自动评估能力。为此,本文提出了 RUM,一种结合规则与大语言模型(LLM)的全面评估方法。RUM 通过快速处理客观指标,同时利用大语言模型对测试用例、测试脚本和测试报告进行深入的主观分析,从而实现全面评估。实验结果表明,与传统的人工测试技能评估相比,RUM 将评估效率提高了 80.77%,成本降低了 97.38%,同时保持了高水平的评估准确性和一致性。通过将 RUM 应用于软件测试大赛,我们发现其不仅提高了软件测试教育中技能评估的效率和可扩展性,还为教师提供了更全面、更客观的学生能力评估依据,促进了个性化教学与学习。这一研究为测试技能的评估提供了新的思路,预计将推动测试过程优化和软件质量保证的进一步发展。
引用
@article{arxiv.2508.12922,
title = {RUM: Rule+LLM-Based Comprehensive Assessment on Testing Skills},
author = {Yue Wang and Zhenyu Chen and Yuan Zhao and Chunrong Fang and Ziyuan Wang and Song Huang},
journal= {arXiv preprint arXiv:2508.12922},
year = {2025}
}