中文

面向社交媒体话语分析的主题驱动关键词抽取

计算与语言 2023-05-30 v2

摘要

社交媒体平台是分享自我报告健康经历的重要资源,提供了关于各类健康话题的丰富数据。尽管自然语言处理(NLP)的进展使得大规模社交媒体数据分析成为可能,但在将关键词抽取应用于健康相关内容方面仍存在空白。关键词抽取用于识别社交媒体话语中的显著概念,而不受预定义实体类别的约束。本文引入了一种专为社交媒体设计的主题驱动关键词抽取框架,这是一种开创性方法,旨在从用户生成的健康文本中捕获临床相关关键词。主题被定义为由抽取任务目标决定的宽泛类别。我们形式化了这一新颖的主题驱动关键词抽取任务,并展示了其在阿片类药物使用障碍治疗用例中高效挖掘社交媒体文本的潜力。本文利用定性与定量分析证明从社交媒体数据提取可操作洞察以及使用最小监督 NLP 模型高效抽取关键词的可行性。我们的贡献包括:开发了用于主题驱动关键词抽取的新型数据收集与整理框架,以及创建了 MOUD-Keyphrase——首个由 Reddit 社区人类标注关键词组成的数据集。我们还明确了最小监督 NLP 模型高效抽取社交媒体数据关键词的范围。最后,我们发现大语言模型(ChatGPT)优于无监督关键词抽取模型,并评估了其在该任务中的效能。

关键词

引用

@article{arxiv.2301.11508,
  title  = {Theme-driven Keyphrase Extraction to Analyze Social Media Discourse},
  author = {William Romano and Omar Sharif and Madhusudan Basak and Joseph Gatto and Sarah Preum},
  journal= {arXiv preprint arXiv:2301.11508},
  year   = {2023}
}

备注

11 pages, 2 figures, submitted to ICWSM. This version represents a substantial expansion and refocus of the previous manuscript, including new experiments, expanded data analysis, and comprehensive discussions