中文

生成合成 Oracle 数据集以分析噪声影响:基于推文的建筑功能分类研究

计算与语言 2025-04-01 v1

摘要

推文为地球观测任务提供了有价值的语义上下文,并作为遥感影像的互补模态。在建筑功能分类(BFC)中,推文通常通过地理启发式方法采集,并借助外部数据库进行标注,这一本质上弱监督的过程会同时引入标签噪声与句子级特征噪声(例如无关或无信息量的推文)。标签噪声已被广泛研究,而句子级特征噪声的影响仍未得到充分探讨,这主要归因于缺乏用于受控分析的干净基准数据集。在本工作中,我们提出一种利用 LLM 生成合成 oracle 数据集的方法,旨在使其仅包含既被正确标注又与其对应建筑语义相关的推文。该 oracle 数据集能够系统地研究在真实数据中难以分离的噪声影响。为评估其效用,我们在三种配置下比较了 Naive Bayes 与 mBERT 分类器的性能:真实训练数据与合成训练数据,以及跨域泛化。结果表明,真实推文中的噪声显著削弱了 mBERT 的上下文学习能力,使其性能退化至与简单基于关键词的模型相当的水平。相反,干净的合成数据集使 mBERT 能够有效学习,并以较大优势超越 Naive Bayes。这些发现凸显了在 BFC 任务中处理特征噪声比提升模型复杂度更为关键。我们的合成数据集为未来的噪声注入研究提供了一种新颖的实验环境,并已在 GitHub 上公开发布。

关键词

引用

@article{arxiv.2503.22856,
  title  = {Generating Synthetic Oracle Datasets to Analyze Noise Impact: A Study on Building Function Classification Using Tweets},
  author = {Shanshan Bai and Anna Kruspe and Xiaoxiang Zhu},
  journal= {arXiv preprint arXiv:2503.22856},
  year   = {2025}
}