多源弱监督模型中的依赖结构设定错误
机器学习
2021-06-22 v1 人工智能
机器学习
摘要
数据编程(DP)已被证明是昂贵的数据手工标注的一种有吸引力的替代方案。在DP中,用户将领域知识编码为\emph{标注函数}(LF),即噪声地标注数据子集且可能具有复杂依赖关系的启发式规则。随后将标签模型拟合到LF上,以产生对未知类标签的估计。标签模型设定错误对下游分类器测试集性能的影响研究不足。这对从业者构成了严重的认知缺口,特别是因为LF之间的依赖结构在DP的实地应用中常被忽略。我们分析由结构过度设定引起的建模误差。我们推导出关于建模误差的新理论界,并经验性地表明该误差可能十分可观,即便在对看似合理的结构建模时亦然。
引用
@article{arxiv.2106.10302,
title = {Dependency Structure Misspecification in Multi-Source Weak Supervision Models},
author = {Salva Rühling Cachay and Benedikt Boecking and Artur Dubrawski},
journal= {arXiv preprint arXiv:2106.10302},
year = {2021}
}
备注
Oral presentation at the Workshop on Weakly Supervised Learning at ICLR 2021