中文

利用词嵌入分析抗议新闻

计算与语言 2022-03-14 v1

摘要

CLEF 2019 ProtestNews事件的前两项任务聚焦于在二分类任务中区分与抗议相关和不相关的文章及句子。在诸多提交方案中,我们选取了两个表现良好的模型,将原有的word2vec和FastText词嵌入替换为ELMo和DistilBERT。与词袋或早期向量方法不同,ELMo和DistilBERT通过捕捉文本中基于上下文信息的语义,将词表示为向量序列。在不改变原模型架构而仅替换词嵌入的情况下,DistilBERT的实现在F1分数上达到0.66,优于FastText实现。DistilBERT在两项任务和两种模型中均优于ELMo。通过去除停用词和词形还原来清洗数据集,在印度新闻文章数据集上训练并在中国新闻文章数据集上评估时,已证明可使模型在不同语境间更具泛化能力。

关键词

引用

@article{arxiv.2203.05875,
  title  = {Using Word Embeddings to Analyze Protests News},
  author = {Maria Alejandra Cardoza Ceron},
  journal= {arXiv preprint arXiv:2203.05875},
  year   = {2022}
}