ToxicChat:揭示真实用户与AI对话中毒性检测被隐藏的挑战
计算与语言
2023-10-27 v1 人工智能
摘要
尽管大语言模型在聊天机器人中取得了显著进展,但维持无毒的用户-AI交互环境如今已变得愈发关键。然而,以往在毒性检测方面的努力大多基于源自社交媒体内容的基准,导致真实世界用户-AI交互所固有的独特挑战未能得到充分探索。在本工作中,我们引入了ToxicChat,一个基于开源聊天机器人真实用户查询的新基准。该基准包含了丰富而微妙的现象,对当前的毒性检测模型而言难以识别,揭示了与社交媒体内容相比显著的领域差异。我们对在现有毒性数据集上训练的模型进行了系统评估,结果表明它们在应用于ToxicChat这一独特领域时存在不足。我们的工作阐明了真实世界用户-AI对话中可能被忽视的毒性检测挑战。未来,ToxicChat可成为推动构建安全健康用户-AI交互环境的宝贵资源。
引用
@article{arxiv.2310.17389,
title = {ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation},
author = {Zi Lin and Zihan Wang and Yongqi Tong and Yangkun Wang and Yuxin Guo and Yujia Wang and Jingbo Shang},
journal= {arXiv preprint arXiv:2310.17389},
year = {2023}
}