中文

通过反内容采样审计并增强COVID-19 misinformation数据集的鲁棒性

机器学习 2023-10-12 v1 人工智能 计算与语言

摘要

本文做出两项关键贡献。首先,本文指出,在小数据上训练的高度专业化稀有内容分类器,通常对真实场景中观察到的负类(称为反内容,anticontent)的丰富性与主题多样性接触有限。因此,这些分类器在测试集上观察到的强劲性能可能无法迁移到真实世界环境中。在COVID-19 misinformation检测的背景下,我们对多个数据集进行了真实场景审计,并表明使用多个被广泛引用的近期数据集训练的模型在真实场景评估中易受反内容影响。其次,我们提出了一种无需人工标注的新型主动学习流程,迭代地用具有挑战性的反内容扩充训练数据,从而增强这些分类器的鲁棒性。

关键词

引用

@article{arxiv.2310.07078,
  title  = {Auditing and Robustifying COVID-19 Misinformation Datasets via Anticontent Sampling},
  author = {Clay H. Yoo and Ashiqur R. KhudaBukhsh},
  journal= {arXiv preprint arXiv:2310.07078},
  year   = {2023}
}

备注

This paper has been accepted at AAAI 2023 (Robust and Safe AI track)