基于标注分歧共形估计的协作式内容审核框架用于毒性检测
计算与语言
2025-09-01 v3 人工智能
人机交互
摘要
内容审核通常结合人工审核员和机器学习模型的努力。然而,这些系统往往依赖于审核过程中出现显著分歧的数据,反映了毒性感知的主观性。我们没有将这种分歧视为噪声,而是将其解释为一种有价值信号,突出了内容固有的歧义性——这是仅考虑多数标签时遗漏的洞察。在这项工作中,我们引入了一种强调捕捉标注分歧重要性的新型内容审核框架。我们的方法采用多任务学习,其中毒性分类作为主要任务,标注分歧作为辅助任务。此外,我们利用不确定性估计技术,特别是共形预测(Conformal Prediction),来同时考虑评论标注中的歧义以及模型在预测毒性和分歧方面的固有不确定性。该框架还允许审核员调整标注分歧的阈值,提供了在何时应由歧义触发审核的灵活性。我们证明联合方法增强了模型性能、校准和不确定性估计,同时提供了更大的参数效率并改进了审核流程,优于单任务方法。
引用
@article{arxiv.2411.04090,
title = {A Collaborative Content Moderation Framework for Toxicity Detection based on Conformalized Estimates of Annotation Disagreement},
author = {Guillermo Villate-Castillo and Javier Del Ser and Borja Sanz},
journal= {arXiv preprint arXiv:2411.04090},
year = {2025}
}
备注
35 pages, 1 figure