中文

通过引导与蒸馏大语言模型实现高效有毒内容检测

计算与语言 2023-12-14 v1 人工智能

摘要

有毒内容检测对于在线服务删除违反社区标准的不当内容至关重要。为自动化检测过程,先前工作提出了多种机器学习(ML)方法来训练语言模型(LMs)进行有毒内容检测。然而,其准确率和跨数据集的可迁移性均有限。近来,大语言模型(LLMs)因其在ML任务上优越的零样本和少样本上下文学习能力以及广泛的迁移性,在有毒内容检测中展现出前景。然而,高效设计LLMs的提示仍具挑战。此外,LLMs的高运行成本可能阻碍其生产部署。为应对这些挑战,本工作中我们提出BD-LLM,一种新颖高效的引导并蒸馏LLMs用于有毒内容检测的方法。具体而言,我们设计了一种名为决策思维树(Decision-Tree-of-Thought, DToT)的新颖提示方法,以提升LLMs的检测性能并提取高质量理由。当LLMs的响应缺乏置信度时,DToT能自动选择更细粒度的上下文重新提示LLMs。此外,我们使用通过DToT提取的理由来微调学生LMs。我们在多个数据集上的实验结果表明,DToT可将LLMs的准确率提升高达4.6%。此外,使用DToT提取的理由微调的学生LMs在所有数据集上均优于基线,准确率提升高达16.9%,同时模型比传统LLMs小60倍以上。最后,我们观察到使用理由微调的学生LMs展现出更好的跨数据集可迁移性。

关键词

引用

@article{arxiv.2312.08303,
  title  = {Efficient Toxic Content Detection by Bootstrapping and Distilling Large Language Models},
  author = {Jiang Zhang and Qiong Wu and Yiming Xu and Cheng Cao and Zheng Du and Konstantinos Psounis},
  journal= {arXiv preprint arXiv:2312.08303},
  year   = {2023}
}