中文

从语义不精确数据中进行的自监督学习

计算机视觉与模式识别 2022-01-28 v2

摘要

在专家标注的训练数据稀缺时,从“动物”或“鸟”这类不精确的标签中学习,却在推理时做出如“雪鹀”般精确的预测,是任何分类器都应具备的重要能力。志愿者贡献或网络爬取得到的结果往往缺乏此类精确性,但仍有价值。关键在于,这些弱标注样本比高质量定制训练数据数量更大、成本更低。近期提出的 CHILLAX 方法通过层次化分类器应对该任务,但存在两大局限:其一,它无法从标注为层次结构根节点(如“物体”)的样本中学习;其二,对精确标签的标注外推仅在测试时进行,而置信度高的外推本可作为训练数据使用。本文中,我们为 CHILLAX 扩展了一种基于约束语义外推生成伪标签的自监督方案,解决了第二个问题,进而也克服了第一个局限,使监督需求比 CHILLAX 更弱。我们通过实验评估该方法,表明其相较 CHILLAX 稳定提升 0.84 至 1.19 个百分点准确率,且可作为无缝替换方案,无训练时间延长等负面后果。

关键词

引用

@article{arxiv.2104.10901,
  title  = {Self-Supervised Learning from Semantically Imprecise Data},
  author = {Clemens-Alexander Brust and Björn Barz and Joachim Denzler},
  journal= {arXiv preprint arXiv:2104.10901},
  year   = {2022}
}

备注

9 pages. Accepted for publication at VISAPP 2022