中文

超越测试者偏见:利用大语言模型以知识库引导模型测试

计算与语言 2023-10-17 v1 软件工程

摘要

当前的模型测试工作大多集中于创建测试用例,而识别测试什么这一步骤在很大程度上被忽视且缺乏支持。我们提出 Weaver,一个支持需求引出以引导模型测试的交互式工具。Weaver 使用大语言模型(LLM)生成知识库并交互式地从中推荐概念,使测试者能够引出进一步测试的需求。Weaver 为测试者提供丰富的外部知识,并鼓励测试者系统性地探索超越自身偏见的多样化概念。在一项用户研究中,我们表明无论是 NLP 专家还是非专家,在使用 Weaver 时都识别出了更多且更多样化的值得测试的概念。他们共同为零样本 ChatGPT 发现了超过 200 个失败测试用例。我们的案例研究进一步表明,Weaver 可帮助从业者在真实场景中测试模型,其中开发者使用 LLM 定义了更细微的应用场景(例如代码理解与转录摘要)。

关键词

引用

@article{arxiv.2310.09668,
  title  = {Beyond Testers' Biases: Guiding Model Testing with Knowledge Bases using LLMs},
  author = {Chenyang Yang and Rishabh Rustogi and Rachel Brower-Sinning and Grace A. Lewis and Christian Kästner and Tongshuang Wu},
  journal= {arXiv preprint arXiv:2310.09668},
  year   = {2023}
}