AEON:一种NLP测试用例自动评估方法
软件工程
2022-05-16 v1 计算与语言
摘要
由于人工测试预言构建的 labor-intensive 特性,已提出多种自动化测试技术以增强自然语言处理(NLP)软件的可靠性。理论上,这些技术对现有测试用例(如带标签的句子)进行变异,并假设生成用例保持等价或相似语义因而标签相同。然而实践中,许多生成的测试用例未能保持相似语义且不自然(如语法错误),导致高误报率与不自然测试用例。我们的评估研究发现,最先进(SOTA)方法生成的测试用例中有44%为误报。这些用例需大量人工核查,且若在模型训练中使用,非但不能改进NLP软件,甚至会使其退化。为解决该问题,我们提出AEON用于NLP测试用例的自动评估(Automatic Evaluation Of NLP test cases)。对每个生成测试用例,它基于语义相似度与语言自然度输出分数。我们使用AEON在三个典型NLP任务、五个数据集上评估四种流行测试技术生成的用例。结果显示AEON与人工判断吻合最佳。特别地,AEON在检测语义不一致测试用例上取得最佳平均精度,超越最佳基线指标10%。此外,AEON在发现不自然测试用例上亦具最高平均精度,超出基线15%以上。并且,用AEON优先排序的测试用例训练模型可得到更准确、更鲁棒的模型,展示了AEON改进NLP软件的潜力。
引用
@article{arxiv.2205.06439,
title = {AEON: A Method for Automatic Evaluation of NLP Test Cases},
author = {Jen-tse Huang and Jianping Zhang and Wenxuan Wang and Pinjia He and Yuxin Su and Michael R. Lyu},
journal= {arXiv preprint arXiv:2205.06439},
year = {2022}
}
备注
13 pages. Accepted to ISSTA 2022