通过标注者共现填补与可证明的对称非负矩阵分解进行众包标注学习
机器学习
2021-06-15 v1 信号处理
摘要
从无噪声、不完整且众包的标注中无监督学习Dawid-Skene(D&S)模型一直是一项长期挑战,也是可靠标注海量数据的关键步骤。近期工作采用耦合非负矩阵分解(CNMF)视角,并展现出引人注目的特性:它保证了D&S模型的可辨识性,且样本复杂度低,因其仅涉及标注者标签共现的估计。然而,在众包背景下,可辨识性仅在满足某些较为限制性条件时成立。优化CNMF准则同样代价高昂,且收敛保证难以捉摸。本工作将基于成对共现的D&S模型学习问题重新表述为对称NMF(SymNMF)问题——相较于CNMF具有增强的可辨识性。实践中,由于部分标注者缺乏共同标注项,SymNMF模型常(大幅)不完整。我们提出两种轻量级算法用于共现填补。随后,提出一种低复杂度的偏移修正线性单元(ReLU)赋能的SymNMF算法以辨识D&S模型。我们还给出了各类性能刻画(如缺失共现可恢复性、稳定性与收敛性)及评估。
引用
@article{arxiv.2106.07193,
title = {Crowdsourcing via Annotator Co-occurrence Imputation and Provable Symmetric Nonnegative Matrix Factorization},
author = {Shahana Ibrahim and Xiao Fu},
journal= {arXiv preprint arXiv:2106.07193},
year = {2021}
}
备注
To appear in ICML 2021