中文

一种用于探索基于卫生的印度政府政策推文的增强文本分类方法

计算与语言 2020-08-19 v2 机器学习

摘要

政府主导的政策制定与方案生成是保护和促进公民社会、经济及个人发展的手段之一。政府对这些方案有效性的评估仅以事实和数据的形式提供统计信息,并未包含公众对该主题的感知、经验和观点的深入认识。在本研究中,我们提出了一种改进的文本分类框架,用于对不同基于卫生的政府方案的 Twitter 数据进行分类。所提框架利用了语言表示模型(LR models)BERT、ELMO 和 USE。然而,由于充足标注数据的匮乏,这些 LR 模型在实时适用性上较弱。为此,我们提出了一种基于 GloVe 词嵌入和类特定情感的新文本增强方法(命名为 Mod-EDA),它通过增加标注数据规模来提升文本分类任务的性能。此外,训练后的模型被用于识别不同群体(如中等收入与低收入群体)中公民对这些政策的参与程度。

关键词

引用

@article{arxiv.2007.06511,
  title  = {An Enhanced Text Classification to Explore Health based Indian Government Policy Tweets},
  author = {Aarzoo Dhiman and Durga Toshniwal},
  journal= {arXiv preprint arXiv:2007.06511},
  year   = {2020}
}

备注

Accepted to KDD 2020: Applied Data Science for Healthcare Workshop (4 pages, 2 figures, 2 tables)