中文

ToVo:通过投票的毒性分类学

计算与语言 2025-01-24 v3 机器学习

摘要

现有的有毒检测模型面临显著限制,如缺乏透明度、定制性和可重复性。这些挑战源于其训练数据的封闭源属性以及对评估机制缺乏解释。为解决这些问题,我们提出了一种将投票和链式思维过程集成以产生高质量开源数据集的机制,用于有毒内容检测。我们的 methodology 确保每个样本的多样化分类指标,包括分类得分和解释性推理。我们利用通过我们提出的机制创建的数据集来训练我们的模型,然后将其与现有的广泛使用的检测器进行比较。我们的做法不仅提高了透明度和可定制性,也促进了更好地针对特定用例进行微调。本工作为开发面向毒性内容检测模型的稳健框架,强调开放性和可适应性,从而为更有效和用户特定的内容 moderation 解决方案之路。

关键词

引用

@article{arxiv.2406.14835,
  title  = {ToVo: Toxicity Taxonomy via Voting},
  author = {Tinh Son Luong and Thanh-Thien Le and Thang Viet Doan and Linh Ngo Van and Thien Huu Nguyen and Diep Thi-Ngoc Nguyen},
  journal= {arXiv preprint arXiv:2406.14835},
  year   = {2025}
}

备注

Findings of NAACL 2025