中文

德国新闻中极端气候事件的话题模型作为二元分类器的检索

计算与语言 2026-05-06 v1

摘要

在极端气候事件媒体覆盖研究中,NLP 方法已成为在大型新闻数据库中识别相关文本的必备工具。然而,足以训练准确深度学习分类器的标注数据往往不可得。话题模型既无监督又可解释,但通常仅用于探索性分析或数据表征。在本研究中,我们探讨如何将话题模型作为二元分类器,用于从德国媒体中检索七类极端气候事件的相关新闻。我们的方法依赖于话题模型估计的后验分布来选择相关文档,而不修改其训练程序。使用标注样本指导评估,我们展示,分配给用于查询新闻数据库的关键词的概率也可用于选择相关话题,从而提高样本精度。我们将结果与微调文本嵌入分类器和开放权重 LLM 进行比较,讨论观察到的权衡,例如 LLM 最低的精度。此外,我们展示结果因灾害而异,这反映出不应将气候事件视为单一类别来进行 NLP 任务。

关键词

引用

@article{arxiv.2605.03450,
  title  = {Retrieving Floods without Floodlights: Topic Models as Binary Classifiers for Extreme Climate Events in German News},
  author = {Brielen Madureira and Mariana Madruga de Brito and Andreas Niekler},
  journal= {arXiv preprint arXiv:2605.03450},
  year   = {2026}
}

备注

Presented at the The 2nd Workshop on Ecology, Environment, and Natural Language Processing at LREC 2026