中文

时间感知数据集是面向新常态的自适应知识库

计算与语言 2022-11-24 v1 机器学习 社会与信息网络

摘要

近期文本分类与语言模型中知识捕获的进展依赖于大规模文本数据集的可用性。然而,语言模型是在静态知识快照上训练的,当知识演化时便显受限。这对于错误 misinformation 检测尤为关键,因为新型错误 misinformation 持续出现,取代旧的宣传战役。我们提出时间感知错误 misinformation 数据集以捕获时间关键现象。本文中,我们首先呈现错误 misinformation 演化的证据,并展示即便纳入简单的时间感知也能显著提升分类器准确率。其次,我们提出 COVID-TAD,一个跨越 25 个月的大规模 COVID-19 错误 misinformation 数据集。它是首个包含数据流多个快照的大规模错误 misinformation 数据集,且比相关错误 misinformation 数据集大数个数量级。我们描述了收集与标注过程,以及初步实验。

关键词

引用

@article{arxiv.2211.12508,
  title  = {Time-Aware Datasets are Adaptive Knowledgebases for the New Normal},
  author = {Abhijit Suprem and Sanjyot Vaidya and Joao Eduardo Ferreira and Calton Pu},
  journal= {arXiv preprint arXiv:2211.12508},
  year   = {2022}
}