中文

通过大语言模型知识蒸馏促进开放域对话系统的色情文本检测

计算与语言 2024-03-21 v1

摘要

在人机交互对话中出现色情内容会对开放域对话系统的用户造成严重的负面影响。然而,关于在人机交互对话中检测色情语言的研究是一个极少被研究的重要课题。为了推进这一方向的研究,我们引入了 CensorChat,一个旨在检测对话会话是否包含色情内容的对话监控数据集。为此,我们收集了现实生活中的真实人机交互对话,并将其分解为单个话语和单轮对话,其中最后一句话由聊天机器人说出。我们提出利用大语言模型的知识蒸馏来标注数据集。具体而言,首先,原始数据集由四个开源大语言模型进行标注,通过多数投票决定标签。其次,我们使用 ChatGPT 更新第一步中的空标签。第三,为了确保验证集和测试集的质量,我们利用 GPT-4 进行标签校准。如果当前标签与 GPT-4 生成的标签不匹配,我们采用自我批评策略来验证其正确性。最后,为了促进色情文本的检测,我们使用伪标签数据集开发了一系列文本分类器。详细的数据分析表明,利用大语言模型的知识蒸馏技术为开发色情文本检测器提供了一种实用且具有成本效益的方法。

关键词

引用

@article{arxiv.2403.13250,
  title  = {Facilitating Pornographic Text Detection for Open-Domain Dialogue Systems via Knowledge Distillation of Large Language Models},
  author = {Huachuan Qiu and Shuai Zhang and Hongliang He and Anqi Li and Zhenzhong Lan},
  journal= {arXiv preprint arXiv:2403.13250},
  year   = {2024}
}

备注

Accepted to CSCWD 2024 (27th International Conference on Computer Supported Cooperative Work in Design). arXiv admin note: text overlap with arXiv:2309.09749