从弱监督学习到主动学习
机器学习
2022-09-26 v1 统计理论
机器学习
统计理论
摘要
自监督学习近期取得成功以来,应用数学与机器计算已引发诸多期待。工业界的许多从业者一直试图从旧范式转向机器学习。有趣的是,那些数据科学家花在抓取、标注和清洗数据上的时间多于微调模型。本论文受以下问题驱动:我们能否推导出比监督学习更通用的框架,以便从杂乱数据中学习?该问题通过弱监督学习的视角切入,假设数据收集的瓶颈在于标注。我们将弱监督建模为给出一组目标候选而非唯一目标。我们认为应寻找一个匹配多数观测的“乐观”函数,由此导出消解部分标签歧义的原则。我们还讨论了将无监督学习技术纳入本框架的优势,特别是通过扩散技术处理的流形正则化,为此我们推导了一种相较基线方法随输入维度扩展性更好的新算法。最后,我们从被动弱监督学习转向主动弱监督学习,引入“主动标注”框架,其中从业者可查询关于所选数据的弱信息。其中,我们利用了一个事实:无需完整信息即可获取随机梯度并执行随机梯度下降。
引用
@article{arxiv.2209.11629,
title = {From Weakly Supervised Learning to Active Learning},
author = {Vivien Cabannes},
journal= {arXiv preprint arXiv:2209.11629},
year = {2022}
}
备注
PhD Thesis, Ecole Normale Superieure, 2022