中文

人工编辑更优:衡量 LLM 生成的_counterfactually augmented data_ 对有害语言检测的有效性

计算与语言 2024-02-27 v3 计算机与社会

摘要

NLP 模型用于多种关键社会计算任务,如检测性别歧视、种族主义或其他仇恨内容。因此,这些模型对伪特征具有鲁棒性至关重要。过去工作尝试利用训练数据增强(包括反事实增强数据(CADs))来解决此类伪特征。CADs 对现有训练数据点引入极小改动并翻转其标签;在其上训练可降低模型对伪特征的依赖。然而,人工生成 CADs 可能耗时且昂贵。因此本工作中,我们评估该任务是否可利用生成式 NLP 模型自动化。我们使用 Polyjuice、ChatGPT 与 Flan-T5 自动生成 CADs,并评估其相比人工生成 CADs 在提升模型鲁棒性上的效用。通过测试多个域外测试集上的模型性能及单个数据点效用,我们的结果表明尽管人工 CADs 仍最有效,ChatGPT 生成的 CADs 紧随其后。自动化方法性能较低的一个关键原因在于它们引入的改动常不足以翻转原始标签。

关键词

引用

@article{arxiv.2311.01270,
  title  = {People Make Better Edits: Measuring the Efficacy of LLM-Generated Counterfactually Augmented Data for Harmful Language Detection},
  author = {Indira Sen and Dennis Assenmacher and Mattia Samory and Isabelle Augenstein and Wil van der Aalst and Claudia Wagner},
  journal= {arXiv preprint arXiv:2311.01270},
  year   = {2024}
}

备注

Preprint of EMNLP'23 paper