中文

通过源感知影响函数理解程序化弱监督

机器学习 2022-05-26 v1 应用统计 机器学习

摘要

程序化弱监督 (Programmatic Weak Supervision, PWS) 将多个弱监督源的源投票聚合成概率训练标签,进而用于训练末端模型。随着其日益流行,亟需某种工具供用户理解流水线中每个组件(如源投票或训练数据)的影响并解释末端模型行为。为此,我们基于影响函数 (Influence Function, IF) 提出源感知 IF,其利用概率标签的生成过程分解末端模型的训练目标,然后计算与每个(数据、源、类别)元组关联的影响。这些原始影响分数可用于估计 PWS 各独立组件(如源投票、监督源和训练数据)的影响。在多个领域的数据集上,我们展示了多种用例:(1) 从多个角度解释错误预测,揭示调试 PWS 流水线的洞见;(2) 识别源的错标,较基线提升 9%–37%;(3) 通过移除训练目标中有害组件提升末端模型泛化性能(较普通 IF 优 13%–24%)。

关键词

引用

@article{arxiv.2205.12879,
  title  = {Understanding Programmatic Weak Supervision via Source-aware Influence Function},
  author = {Jieyu Zhang and Haonan Wang and Cheng-Yu Hsieh and Alexander Ratner},
  journal= {arXiv preprint arXiv:2205.12879},
  year   = {2022}
}

备注

21 pages