融合众包与主动学习用于推文工作生活事件分类
计算与语言
2020-04-03 v2 机器学习
社会与信息网络
机器学习
摘要
社交媒体,尤其是 Twitter,正越来越多地用于预测分析研究。在社交媒体研究中,自然语言处理(NLP)技术与基于专家的人工及定性分析结合使用。然而,社交媒体数据是非结构化的,必须经过复杂处理才能用于研究。人工标注是最耗费资源和时间的过程,多位专家评分者必须对每一项达成共识,但对于创建用于训练基于 NLP 的机器学习分类器的金标准数据集而言必不可少。为减轻人工标注负担同时保持其可靠性,我们设计了一种结合主动学习策略的众包流程。我们通过一项从个人推文中识别失业事件的案例研究证明了其有效性。我们使用 Amazon Mechanical Turk 平台从互联网招募标注者,并设计了若干质量控制措施以确保标注准确性。我们评估了 4 种不同的主动学习策略(即最小置信度、熵、投票熵和 Kullback-Leibler 散度)。这些主动学习策略旨在减少达到预期自动分类性能所需的推文数量。结果表明,众包有助于创建高质量标注,且主动学习有助于减少所需推文数量,尽管所测试的各策略间无实质性差异。
引用
@article{arxiv.2003.12139,
title = {Integrating Crowdsourcing and Active Learning for Classification of Work-Life Events from Tweets},
author = {Yunpeng Zhao and Mattia Prosperi and Tianchen Lyu and Yi Guo and Jiang Bian},
journal= {arXiv preprint arXiv:2003.12139},
year = {2020}
}