基于聚类与提示的自然语言处理行为测试用例自动生成
计算与语言
2024-08-09 v2 人工智能
新兴技术
机器学习
摘要
自然语言处理(NLP)模型的行为测试近期研究(如 Checklist)受软件工程测试相关范式启发。它们允许评估通用语言能力和领域理解,因此有助于评估概念合理性并识别模型弱点。然而,一个主要挑战是测试用例的创建。当前工具包依赖需要领域专业知识且耗时的手动开发的半自动化方法。本文提出了一种利用大语言模型和统计技术的力量自动开发测试用例的方法。该方法对文本表示进行聚类以精心构建有意义的组,然后应用提示技术自动生成最小功能测试(MFT)。使用著名的 Amazon Reviews 语料库来演示我们的方法。我们分析了四种不同分类算法的行为测试特征,并讨论了这些模型的局限性和优势。
引用
@article{arxiv.2408.00161,
title = {Automatic Generation of Behavioral Test Cases For Natural Language Processing Using Clustering and Prompting},
author = {Ying Li and Rahul Singh and Tarun Joshi and Agus Sudjianto},
journal= {arXiv preprint arXiv:2408.00161},
year = {2024}
}