中文

用分类器策划语料库:以线上清洁能源舆情为例

计算与语言 2025-02-14 v3 计算机与社会

摘要

精心策划的、包含广泛公众意见的大规模社交媒体帖子语料库,提供了补充传统调查的一种替代数据源。虽然调查在收集代表性样本方面有效且能达到高准确度,但其运行成本高昂,且滞后公众意见数天或数周。这两种缺陷都可通过实时、高容量的数据流与快速分析流水线克服。构建此类数据流水线的核心挑战是设计一种有效方法,用于快速选取最佳相关文档语料库以供分析。仅用关键词查询常包含难以用词袋自然语言处理方法消歧的无关文档。在此,我们探索语料库策划方法,使用预训练的基于 transformer 的模型过滤无关推文,这些模型针对我们手工标注推文的二分类任务进行了微调。我们取得了高达 0.95 的 F1 分数。微调此类模型的低成本与高性能表明,我们的方法作为具有不确定语料边界的社交媒体数据集的预处理步骤可能具有广泛益处。

关键词

引用

@article{arxiv.2305.03092,
  title  = {Curating corpora with classifiers: A case study of clean energy sentiment online},
  author = {Michael V. Arnold and Peter Sheridan Dodds and Christopher M. Danforth},
  journal= {arXiv preprint arXiv:2305.03092},
  year   = {2025}
}

备注

12 pages, 6 figures