从有偏毒性标签中学习的实证探究
机器学习
2021-10-05 v1 计算机与社会
摘要
从人类标注者处收集标注常导致所希望收集标签的数量与这些标签的质量之间的权衡。因此,通常只能收集到少量高质量标签。在本文中,我们研究不同的训练策略如何利用一小部分人工标注标签和一大但含噪的合成生成标签(其对身份群体表现出偏见)来预测在线评论的毒性。我们评估这些方法的准确性和公平性属性,以及两者间的权衡。虽然我们发现先在全部数据上训练再在干净数据上微调可产生具有最高AUC的模型,但我们发现没有任何单一策略在所有公平性指标上均表现最佳。
引用
@article{arxiv.2110.01577,
title = {An Empirical Investigation of Learning from Biased Toxicity Labels},
author = {Neel Nanda and Jonathan Uesato and Sven Gowal},
journal= {arXiv preprint arXiv:2110.01577},
year = {2021}
}
备注
8 pages, 6 figures. Accepted to the Socially Responsible Machine Learning Workshop, ICML 2021