中文

SYNTHEVAL:基于合成 CheckList 的 NLP 模型混合行为测试

计算与语言 2024-11-08 v2

摘要

NLP 中的传统基准测试通常涉及使用静态的留出测试集。然而,这种方法往往导致性能高估,且缺乏对 NLP 模型进行全面、可解释和动态评估的能力。近期,DynaBench (Kiela et al., 2021) 和 CheckList (Ribeiro et al., 2020) 等工作通过使用多步人工标注流程生成的测试类型对 NLP 模型进行行为测试,从而解决了这些局限性。遗憾的是,手动创建多种测试类型需要大量人力,且成本往往高昂得令人望而却步。在本工作中,我们提出了 SYNTHEVAL,这是一个混合行为测试框架,利用大语言模型(LLMs)生成广泛的测试类型,以全面评估 NLP 模型。SYNTHEVAL 首先通过受控生成利用 LLMs 生成句子,然后通过将 LLMs 的预测与特定任务的 NLP 模型进行比较来识别具有挑战性的样本。在最后阶段,人类专家研究这些具有挑战性的样本,手动设计模板,并识别特定任务模型持续表现出的失败类型。我们将 SYNTHEVAL 应用于两个分类任务:情感分析和有毒语言检测,并表明我们的框架能有效识别强模型在这些任务上的弱点。我们在 https://github.com/Loreley99/SynthEval_CheckList 分享了我们的代码。

关键词

引用

@article{arxiv.2408.17437,
  title  = {SYNTHEVAL: Hybrid Behavioral Testing of NLP Models with Synthetic CheckLists},
  author = {Raoyuan Zhao and Abdullatif Köksal and Yihong Liu and Leonie Weissweiler and Anna Korhonen and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2408.17437},
  year   = {2024}
}

备注

EMNLP 2024 - Findings