面向不可分解度量优化的代价敏感自训练
机器学习
2023-05-01 v1 计算与语言
计算机视觉与模式识别
摘要
基于自训练的半监督学习算法仅使用少量标注数据即可学习到高度准确的深度神经网络。然而,自训练相关工作大多聚焦于提升准确率这一目标,而实际机器学习系统可能具有复杂的、本质上不可分解的目标(例如最大化各类召回率的最小值等)。本文引入代价敏感自训练(Cost-Sensitive Self-Training, CSST)框架,将基于自训练的方法推广至不可分解度量的优化。我们证明,在自训练分析所采用的类似数据分布假设下,该框架能更好地利用无标注数据优化所需的不可分解度量。基于所提出的CSST框架,我们获得了用于深度神经网络优化不同不可分解度量的实用自训练方法(涵盖视觉与NLP任务)。结果表明,在多数数据集与目标组合下,CSST均优于当前最优方法。
引用
@article{arxiv.2304.14738,
title = {Cost-Sensitive Self-Training for Optimizing Non-Decomposable Metrics},
author = {Harsh Rangwani and Shrinivas Ramasubramanian and Sho Takemori and Kato Takashi and Yuhei Umeda and Venkatesh Babu Radhakrishnan},
journal= {arXiv preprint arXiv:2304.14738},
year = {2023}
}
备注
NeurIPS 2022. Code: https://github.com/val-iisc/CostSensitiveSelfTraining