利用噪声网络数据中的多模态课程进行大规模概念学习
计算机视觉与模式识别
2016-07-19 v1 机器学习
摘要
在无需额外人工标注的情况下,从庞大但含噪的网络数据中自动学习视频概念检测器,是多媒体和机器学习社区中一个新颖且充满挑战的领域。网络上的大量视频关联着丰富但含噪的上下文信息,例如标题,这些信息提供了关于视频内容的弱标注或标签。为了利用这些庞大且含噪的网络标签,本文提出了一种名为 WEbly-Labeled Learning (WELL) 的新方法,该方法建立在受人类学习过程启发的前沿机器学习算法之上。WELL 引入了多种新颖的多模态方法,以从含噪网络视频中融入被称为课程的有意义的先验知识。为了研究这一问题,我们实证研究了从 YouTube 和 Flickr 收集的视频的多模态特征所构建的课程。WELL 的有效性和可扩展性在两个公开基准数据集上得到了广泛验证,包括最大的多媒体数据集和最大的人工标注视频集。综合实验结果表明,在从含噪网络视频数据中学习概念方面,WELL 以具有统计显著性的优势优于前沿研究。此外,结果也验证了 WELL 对视频数据中的噪声水平具有鲁棒性。值得注意的是,在充足的含噪网络标签上训练的 WELL 能够达到与在干净人工标注数据上训练的监督学习方法相当的准确率。
引用
@article{arxiv.1607.04780,
title = {Exploiting Multi-modal Curriculum in Noisy Web Data for Large-scale Concept Learning},
author = {Junwei Liang and Lu Jiang and Deyu Meng and Alexander Hauptmann},
journal= {arXiv preprint arXiv:1607.04780},
year = {2016}
}