XPASC:通过可解释性与关联性度量弱监督中的泛化能力
机器学习
2022-11-23 v2 性能
摘要
弱监督因其能以极少人工代价创建大量标注数据,被广泛应用于众多领域与任务。标准方法使用标注函数指定与标注相关的信号。有猜想认为弱监督模型过度依赖这些信号,并因此遭受过拟合。为验证该假设,我们引入一种新方法 XPASC(eXPlainability-Association SCore),用于度量用弱监督数据集训练的模型的泛化能力。考虑数据集中特征、类别和标注函数的出现情况,XPASC 顾及每个特征对模型预测的相关性,以及特征分别与类别和标注函数的关联性。XPASC 中的关联性可用两种变体度量:XPASC-CHI SQAURE 度量相对于统计显著性的关联,而 XPASC-PPMI 更一般地度量关联强度。我们使用 XPASC 分析 KnowMAN,一种旨在控制来自标注函数的泛化程度从而缓解过拟合问题的对抗式架构。一方面,我们表明 KnowMAN 能够通过超参数控制泛化程度。另一方面,结果与定性分析显示泛化与性能并非一一对应,且最高泛化程度未必意味着最佳性能。因此允许控制泛化量的方法可达到适度良性过拟合的程度。我们在本研究中的贡献为:i) 用于度量弱监督模型泛化能力的 XPASC 分数,ii) 跨数据集与模型对 XPASC 的评估,以及 iii) 发布 XPASC 实现。
引用
@article{arxiv.2206.01444,
title = {XPASC: Measuring Generalization in Weak Supervision by Explainability and Association},
author = {Luisa März and Ehsaneddin Asgari and Fabienne Braune and Franziska Zimmermann and Benjamin Roth},
journal= {arXiv preprint arXiv:2206.01444},
year = {2022}
}
备注
26 pages, 20 Figures, 5 Tables