中文

社交媒体帖子风险分类的迁移学习:模型评估研究

计算与语言 2019-07-12 v2

摘要

精神疾病影响着全球人口的很大一部分。在线心理健康论坛可为患者提供支持性环境,并产生大量数据,可通过机器学习方法挖掘以预测心理健康状态。我们对社交媒体帖子的多种文本特征表示方法进行了基准测试,并比较了它们与自动化机器学习(AutoML)工具在下游用于内容分流以引起版主注意的应用。我们使用了来自CLPsych 2017共享任务的1588条标注帖子,这些帖子收集自Reachout.com论坛(Milne等,2019)。帖子使用基于词典的工具(包括VADER、Empath、LIWC)进行表示,并使用了预训练的人工神经网络模型(包括DeepMoji、Universal Sentence Encoder和GPT-1)。我们使用TPOT和auto-sklearn作为AutoML工具来生成对帖子进行分流的分类器。性能最优的系统使用了从GPT-1模型导出的特征,该模型在超过150,000条来自Reachout.com的未标注帖子上进行了微调。我们的顶级系统的宏平均F1得分为0.572,在CLPsych 2017任务上提供了新的最先进(state-of-the-art, SOTA)结果。这在不利用元数据或前文帖子的额外信息的情况下实现。误差分析显示该顶级系统常遗漏无望感的表达。我们还提供了有助于理解所学分类器的可视化。我们表明迁移学习是用相对较少标注数据预测风险的有效策略。我们注意到,当有大量未标注文本可用时,预训练语言模型的微调可带来进一步提升。

关键词

引用

@article{arxiv.1907.02581,
  title  = {Transfer Learning for Risk Classification of Social Media Posts: Model Evaluation Study},
  author = {Derek Howard and Marta Maslej and Justin Lee and Jacob Ritchie and Geoffrey Woollard and Leon French},
  journal= {arXiv preprint arXiv:1907.02581},
  year   = {2019}
}