通过EM算法缓解基于风险的主动学习中的采样偏差
机器学习
2022-06-28 v1 应用统计
机器学习
摘要
基于风险的主动学习是一种用于开发在线决策支持统计分类器的方法。在该方法中,数据标签查询根据初始数据点的完美信息期望价值来引导。对于结构健康监测(SHM)应用,信息价值相对于维护决策过程进行评估,数据标签查询对应于对结构进行检查以确定其健康状态。采样偏差是主动学习范式中的已知问题;这发生在主动学习过程对特征空间的特定区域过采样或欠采样时,从而导致训练集不能代表底层分布。该偏差最终降低决策性能,并因此产生不必要的成本。本文概述了一种利用半监督高斯混合模型的基于风险的主动学习方法。该半监督方法通过EM算法为未标记数据引入伪标签来抵消采样偏差。该方法在代表SHM中决策过程的数值示例上进行了演示。
引用
@article{arxiv.2206.12598,
title = {Mitigating sampling bias in risk-based active learning via an EM algorithm},
author = {Aidan J. Hughes and Lawrence A. Bull and Paul Gardner and Nikolaos Dervilis and Keith Worden},
journal= {arXiv preprint arXiv:2206.12598},
year = {2022}
}
备注
10 pages, 8 figures. The Tenth European Workshop on Structural Health Monitoring (EWSHM 2022), Palermo, Italy, July 2022. arXiv admin note: substantial text overlap with arXiv:2201.02555. text overlap with arXiv:2206.11616