中文

MiDAS:面向假新闻检测的多集成域自适应监督方法

机器学习 2022-05-23 v1 计算与语言

摘要

与COVID-19相关的错误信息和假新闻被称为“信息疫情”,在过去几年中急剧增加。这些错误信息表现出概念漂移,即假新闻的分布随时间变化,降低了先前训练的假新闻检测模型的有效性。给定一组在多个域上训练的假新闻模型,我们提出一个自适应决策模块,为新样本选择最适配的模型。我们提出MiDAS,一种用于假新闻检测的多域自适应方法,其对现有模型与新样本的相关性进行排序。MiDAS包含两个部分:一个域不变编码器和一种自适应模型选择器。MiDAS集成多个预训练和微调的模型及其训练数据,以创建域不变表示。然后,MiDAS利用不变嵌入空间的局部Lipschitz平滑性来估计每个模型对新样本的相关性。排名较高的模型提供预测,排名较低的模型弃用。我们在9个假新闻数据集上评估MiDAS对漂移数据的泛化能力,这些数据集分别来自不同的域和模态。MiDAS在多域自适应分布外假新闻分类上取得了新的SOTA性能。

关键词

引用

@article{arxiv.2205.09817,
  title  = {MiDAS: Multi-integrated Domain Adaptive Supervision for Fake News Detection},
  author = {Abhijit Suprem and Calton Pu},
  journal= {arXiv preprint arXiv:2205.09817},
  year   = {2022}
}

备注

We use Lipschitz smoothness and probabilistic Lipschitzness to build a theoretical foundation for effective multi-domain adaptation using randomized perturbations on unseen data