Toxicity Inspector:通过反馈评估毒性检测中真实标签的框架
计算与语言
2023-05-19 v1 社会与信息网络
摘要
毒性语言难以定义,因为它并非单一形态,且在毒性感知上存在诸多差异。毒性语言检测的此一挑战因其解释的高度语境依赖与主观性而加剧,这会削弱数据集的可靠性并负面影响检测模型性能。为填补此空白,本文引入一个毒性检查器框架,其结合人在回路流水线,旨在通过以评估者价值观为中心的迭代反馈循环来提升毒性基准数据集的可靠性。该框架的核心为迭代反馈过程,由两类指标(硬指标与软指标)引导,为评估者与数据集创建者提供深入审视,以平衡性能增益与毒性规避之间的权衡。
引用
@article{arxiv.2305.10433,
title = {Toxicity Inspector: A Framework to Evaluate Ground Truth in Toxicity Detection Through Feedback},
author = {Huriyyah Althunayan and Rahaf Bahlas and Manar Alharbi and Lena Alsuwailem and Abeer Aldayel and Rehab ALahmadi},
journal= {arXiv preprint arXiv:2305.10433},
year = {2023}
}
备注
To appear in Workshop on 2nd Workshop on Novel Evaluation Approaches for Text Classification Systems (NEATCLasS-2023).ICWSM, AAAI, 2023