中文

BERT 嵌入在推特数据灾难预测中的有效性

计算与语言 2021-08-25 v1 机器学习

摘要

Twitter 等社交媒体提供了一个共享和交流个人经历的通用平台。人们经常在社交媒体上发布自己的生活经历、本地新闻和事件以告知他人。许多救援机构定期监控此类数据以识别灾难并降低生命风险。然而,人类不可能手动检查海量数据并实时识别灾难。为此,许多研究工作提出将词语表示为机器可理解的表示,并在词表示上应用机器学习方法来识别文本情感。以往的研究方法对给定文档中的词提供单一表示或嵌入。然而,近期先进的上下文嵌入方法(BERT)为同一词在不同上下文中构造不同的向量。BERT 嵌入已成功用于不同的自然语言处理(NLP)任务,但尚无具体分析这些表示如何有助于灾难类推文分析。在本研究中,我们探索 BERT 嵌入在推特数据灾难预测中的有效性,并将其与传统无上下文词嵌入方法(GloVe、Skip-gram 和 FastText)进行比较。我们为此同时使用了传统机器学习方法和深度学习方法。我们提供了本研究的定量与定性结果。结果表明,BERT 嵌入在灾难预测任务中的效果优于传统词嵌入。我们的代码已免费向研究社区开放。

关键词

引用

@article{arxiv.2108.10698,
  title  = {Efficacy of BERT embeddings on predicting disaster from Twitter data},
  author = {Ashis Kumar Chanda},
  journal= {arXiv preprint arXiv:2108.10698},
  year   = {2021}
}