基于解耦置信学习的偏见感知式误标检测
机器学习
2025-07-15 v2 人工智能
数据库
人机交互
摘要
可靠数据是现代组织系统的基石。标注偏见是一种数据完整性挑战,指标签存在系统性错误,即是定性分析中核心协变,其质量在不同社会群体间有所不同。这类偏见已被概念性和实证地探索,广泛被认可为关键领域的紧迫问题。然而,针对此问题的有效方法仍寥寥。本文提出了解耦置信学习(DeCoLe),一个专为检测受标注偏见数据集中误标实例而设计的基于机器学习的框架,使能够偏见感知式地检测误标,促进数据质量改进。我们理论上论证了DeCoLe的有效性,并在标注偏见是众所周知挑战的hate speech检测领域中评估其性能。实证结果表明,DeCoLe在偏见感知式误标检测方面表现卓越,持续优于替代方法。我们的工作识别并解决了偏见感知式误标检测的挑战,并为如何将DeCoLe集成到组织数据管理实践中作为提升数据可靠性的强大工具提供了指导。
引用
@article{arxiv.2507.07216,
title = {Bias-Aware Mislabeling Detection via Decoupled Confident Learning},
author = {Yunyi Li and Maria De-Arteaga and Maytal Saar-Tsechansky},
journal= {arXiv preprint arXiv:2507.07216},
year = {2025}
}