中文

如良邻一般:实用的内容审核与文本分类

计算与语言 2024-01-30 v3

摘要

少样本文本分类系统能力惊人,但由于依赖提示与十亿参数语言模型,难以可靠部署与使用。SetFit(Tunstall 等,2022)是近期一种实用方法,其在对比学习范式下微调 Sentence Transformer,并取得了与更笨重系统相近的结果。廉价的文本分类对于解决所有分类任务中的域漂移问题十分重要,尤其在检测困扰社交媒体平台的有害内容方面。在此,我们提出 Like a Good Nearest Neighbor(LaGoNN),一种对 SetFit 的改进,其不引入可学习参数,而是利用训练数据中最近邻的信息(例如标签与文本)来改动输入文本,使新数据显得类似于模型所优化的某个实例。LaGoNN 能有效标记不良内容与进行文本分类,并提升了 SetFit 的性能。为证明 LaGoNN 的价值,我们在四种标签分布下,以及通用与多语言分类设定中,对内容审核背景下的文本分类系统进行了深入研究。

关键词

引用

@article{arxiv.2302.08957,
  title  = {Like a Good Nearest Neighbor: Practical Content Moderation and Text Classification},
  author = {Luke Bates and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2302.08957},
  year   = {2024}
}

备注

Accepted to EACL 2024