TestAug:一种用于增强基于能力的 NLP 测试的框架
软件工程
2022-10-18 v1 人工智能
计算与语言
机器学习
摘要
近期提出的基于能力的 NLP 测试允许模型开发者测试 NLP 模型的功能能力,揭示传统留出机制无法检测到的功能失效。然而,现有基于能力的测试工作需耗费大量人工并依赖领域专家来创建测试用例。本文中,我们研究了一种利用 GPT-3 引擎生成测试用例的低成本方法。我们进一步提出使用分类器剔除 GPT-3 的无效输出,并将输出扩展为模板以生成更多测试用例。我们的实验表明,TestAug 相比现有的行为测试工作具有三方面优势:(1)TestAug 能发现比现有工作更多的缺陷;(2)TestAug 中的测试用例更具多样性;(3)TestAug 大幅节省了创建测试套件的人工投入。TestAug 的代码与数据可在我们的项目网站(https://guanqun-yang.github.io/testaug/)和 GitHub(https://github.com/guanqun-yang/testaug)获取。
引用
@article{arxiv.2210.08097,
title = {TestAug: A Framework for Augmenting Capability-based NLP Tests},
author = {Guanqun Yang and Mirazul Haque and Qiaochu Song and Wei Yang and Xueqing Liu},
journal= {arXiv preprint arXiv:2210.08097},
year = {2022}
}
备注
Accepted by COLING 2022; Presentation Video: https://www.youtube.com/watch?v=X0p8J57qxeg; Website: https://guanqun-yang.github.io/testaug/; GitHub: https://github.com/guanqun-yang/testaug