中文

多源弱监督模型中的依赖结构设定错误

机器学习 2021-06-22 v1 人工智能 机器学习

摘要

数据编程(DP)已被证明是昂贵的数据手工标注的一种有吸引力的替代方案。在DP中,用户将领域知识编码为\emph{标注函数}(LF),即噪声地标注数据子集且可能具有复杂依赖关系的启发式规则。随后将标签模型拟合到LF上,以产生对未知类标签的估计。标签模型设定错误对下游分类器测试集性能的影响研究不足。这对从业者构成了严重的认知缺口,特别是因为LF之间的依赖结构在DP的实地应用中常被忽略。我们分析由结构过度设定引起的建模误差。我们推导出关于建模误差的新理论界,并经验性地表明该误差可能十分可观,即便在对看似合理的结构建模时亦然。

关键词

引用

@article{arxiv.2106.10302,
  title  = {Dependency Structure Misspecification in Multi-Source Weak Supervision Models},
  author = {Salva Rühling Cachay and Benedikt Boecking and Artur Dubrawski},
  journal= {arXiv preprint arXiv:2106.10302},
  year   = {2021}
}

备注

Oral presentation at the Workshop on Weakly Supervised Learning at ICLR 2021