基于生成式提示推理的毒性检测
计算与语言
2022-05-26 v1 人工智能
摘要
由于文本中不良内容的微妙性、隐含性以及不同人可能作出的不同解读,从文本中检测不良内容是一项细微的难题。众所周知的风险是,语言模型(LMs)一旦在含有不良内容的语料上训练,便有能力表现出偏见与毒性。然而,近期研究表明,作为补救,LMs 也能够在无需额外微调的情况下识别毒性内容。提示方法已被证明能有效利用这一令人惊讶的自诊断能力。但现有的基于提示的方法通常以判别方式向语言模型指定指令。在这项工作中,我们探索了零样本基于提示的毒性检测的生成式变体,并对提示工程进行了全面试验。我们在三个带有社交媒体帖子毒性标注的数据集上进行了评估。我们的分析从定量和定性两方面凸显了生成式分类方法的优势。文中讨论了自诊断的有趣方面及其伦理影响。
引用
@article{arxiv.2205.12390,
title = {Toxicity Detection with Generative Prompt-based Inference},
author = {Yau-Shian Wang and Yingshan Chang},
journal= {arXiv preprint arXiv:2205.12390},
year = {2022}
}