从众所得噪声标签中学习:信号处理视角
信号处理
2025-07-04 v2 人工智能
人机交互
机器学习
摘要
人工智能(AI)和机器学习(ML)的快速发展离不开大规模、精确标注数据集的可用性。众包是一种常用的标注方法,将数据分发给多个标注员,再将产生的标签融合以服务于下游学习和推理任务。这种标注过程常常因标注员的专业能力有限或不可靠等原因导致标签噪声。因此,众包的核心目标是开发有效的方法来减轻此类标签噪声对学习任务的负面影响。本特色文章介绍了从众所得噪声标签中学习的最新进展。文章聚焦于关键众包模型及其方法论处理,从经典统计模型到近期基于深度学习的方法,强调分析见解和算法发展。特别是,本文综述了信号处理(SP)理论与方法,如张量和非负矩阵分解的可识别性,以及解决众包长期挑战的新颖、原则性解决方案——展示了SP视角如何推动该领域的发展。此外,本文还涉及一些关键的新兴主题,如众包强化学习与人类反馈(RLHF)和直接偏好优化(DPO),这些是微调大型语言模型(LLM)的关键技术。
引用
@article{arxiv.2407.06902,
title = {Learning From Crowdsourced Noisy Labels: A Signal Processing Perspective},
author = {Shahana Ibrahim and Panagiotis A. Traganitis and Xiao Fu and Georgios B. Giannakis},
journal= {arXiv preprint arXiv:2407.06902},
year = {2025}
}