基于标签比例深度学习的协同训练用于人口统计分类
计算机视觉与模式识别
2018-01-01 v1 机器学习
机器学习
摘要
深度学习算法最近在许多分类任务中取得了最先进的准确率,但这种成功通常依赖于大量标注训练样本。对于缺乏此类数据的领域,一个有吸引力的替代方案是使用轻量或远距离监督来训练模型。本文介绍了一种用于标签比例学习(Learning from Label Proportions, LLP)场景的深度神经网络,其中训练数据由未标注实例的包组成,每个包附有对应的标签分布。我们提出了一种新的正则化层——Batch Averager,可附加到任何深度神经网络的最后一层,将其从监督学习转换为LLP。该层可利用现有深度学习包轻松实现。为了进一步支持数据由两个条件独立的特征视图(例如图像和文本)组成的领域,我们提出了一种协同训练算法,迭代生成伪包并重新拟合深度LLP模型以提高分类准确率。我们在人口统计属性分类(性别与种族/民族)上展示了模型,该任务在社交媒体分析、公共卫生和营销中有许多应用。我们开展了实验,基于推文和用户头像预测Twitter用户的人口统计属性,无需任何用户级标注进行训练。我们发现深度LLP方法在文本和图像特征上分别优于基线。此外,我们发现协同训练算法将图像和文本分类的绝对F1分别提高了4%和8%。最后,文本与图像分类器的集成进一步使平均绝对F1度量提高了4%。
引用
@article{arxiv.1709.04108,
title = {Co-training for Demographic Classification Using Deep Learning from Label Proportions},
author = {Ehsan Mohammady Ardehaly and Aron Culotta},
journal= {arXiv preprint arXiv:1709.04108},
year = {2018}
}