中文

通过知识蒸馏促进开放域对话系统中 NSFW 文本检测

计算与语言 2024-03-22 v3

摘要

在对话语境中,NSFW(Not Safe for Work,不宜在工作场所浏览)内容会对开放域对话系统中的用户产生严重的副作用。然而,关于在对话语境中检测 NSFW 语言尤其是露骨性内容的研究明显滞后。为解决此问题,我们引入 CensorChat,一个面向 NSFW 对话检测的对话监控数据集。利用涉及 GPT-4 和 ChatGPT 的知识蒸馏技术,该数据集提供了一种构建 NSFW 内容检测器的经济高效手段。此过程包括收集真实的人机交互数据,并将其拆解为单句话语和单轮对话,由聊天机器人给出最后一句话语。ChatGPT 用于标注未标记数据,作为训练集。利用 ChatGPT 和 GPT-4 作为标注者构建原理验证和测试集,并采用自我批评策略解决标注分歧。一个 BERT 模型在伪标记数据上被微调为文本分类器,并评估了其性能。本研究强调 AI 系统在数字对话中优先保障用户安全与福祉的同时尊重表达自由的重要性。所提方法不仅推进了 NSFW 内容检测,也契合 AI 驱动对话中不断演进的用户保护需求。

关键词

引用

@article{arxiv.2309.09749,
  title  = {Facilitating NSFW Text Detection in Open-Domain Dialogue Systems via Knowledge Distillation},
  author = {Huachuan Qiu and Shuai Zhang and Hongliang He and Anqi Li and Zhenzhong Lan},
  journal= {arXiv preprint arXiv:2309.09749},
  year   = {2024}
}

备注

As we have submitted a final version arXiv:2403.13250, we decide to withdraw it