CONDA:用于游戏内毒性理解与检测的情景化双重标注数据集
计算与语言
2021-07-26 v2
摘要
传统的毒性检测模型聚焦于单句话语层面,缺乏对语境的深层理解。我们引入CONDA,一个用于游戏内毒性语言检测的新数据集,支持联合意图分类与槽填充分析,后者是自然语言理解(NLU)的核心任务。该数据集由来自1.9K场已结束Dota 2比赛聊天日志的12K段对话中的45K条话语组成。我们提出一个鲁棒的双重语义层级毒性框架,处理话语级与词元级模式,以及丰富的情景化聊天历史。随数据集附带的是细致的游戏内毒性分析,在话语、词元和双重层级上提供对语境的全面理解。受NLU启发,我们也将它的度量应用于毒性检测任务以评估毒性与游戏特定方面。我们在CONDA上评估了强大的NLU模型,为不同意图类与槽类给出了细粒度结果。此外,我们通过与其他毒性数据集比较,考察了本数据集中毒性性质的覆盖度。
引用
@article{arxiv.2106.06213,
title = {CONDA: a CONtextual Dual-Annotated dataset for in-game toxicity understanding and detection},
author = {Henry Weld and Guanghao Huang and Jean Lee and Tongshu Zhang and Kunze Wang and Xinghong Guo and Siqu Long and Josiah Poon and Soyeon Caren Han},
journal= {arXiv preprint arXiv:2106.06213},
year = {2021}
}
备注
Accepted by ACL-IJCNLP 2021