无强监督的 Instagram 数据深度文本挖掘
计算与语言
2019-09-25 v1 信息检索
机器学习
摘要
随着社交媒体的出现,我们的在线信息流日益由简短、非正式且非结构化的文本构成。这些文本数据可被用于改进用户推荐和趋势检测。Instagram 是最大的社交媒体平台之一,同时包含文本与图像。然而,此前社交媒体文本处理的研究多聚焦于 Twitter 数据分析,对 Instagram 数据的文本挖掘关注甚少。此外,许多文本挖掘方法依赖标注训练数据,而实践中此类数据难以获取且成本高昂。本文提出从 Instagram 文本中无监督挖掘时尚属性的方法,可支持时尚领域一种新型用户推荐。在此背景下,我们分析时尚领域 Instagram 帖子语料,介绍一个从 Instagram 提取时尚属性的系统,并以弱监督训练一个深度服装分类器,基于关联文本对 Instagram 帖子分类。实验证实词嵌入是信息提取的有用资源。实验结果显示,使用词嵌入的信息提取优于基于 Levenshtein 距离的基线。结果还表明,使用生成模型而非多数投票来组合弱监督信号更有益。借助弱监督与生成建模,仅依据关联文本对 Instagram 帖子图像内容分类的任务取得了 0.61 的 F1 分数,达到人类水平。最后,我们的实证研究是少数关于 Instagram 文本的研究之一,表明该文本含噪、文本分布呈现长尾现象,且 Instagram 评论区为多语言。
引用
@article{arxiv.1909.10812,
title = {Deep Text Mining of Instagram Data Without Strong Supervision},
author = {Kim Hammar and Shatha Jaradat and Nima Dokoohaki and Mihhail Matskin},
journal= {arXiv preprint arXiv:1909.10812},
year = {2019}
}
备注
8 pages, 5 figures. Pre-print for paper to appear in conference proceedings for the Web Intelligence Conference