中文

基于多模态特征对齐的鲁棒跨域错误信息检测

人工智能 2023-11-27 v1

摘要

社交媒体错误信息危害个人与社会,并因快速增长的包含文本与图像的多模态内容(其比纯文本新闻具有更高“可信度”)而加剧。尽管现有有监督错误信息检测方法在关键设定下已取得可接受性能,但它们可能需要来自不同事件的大量标注数据,这耗时且繁琐。反之,直接利用公开可用数据集训练模型可能因训练数据(即源域)与目标域数据之间的域偏移而泛化失败。多数先前关于域偏移的工作聚焦于单一模态(如文本模态),并忽略了早期阶段可能不易获得充足无标注目标域数据的场景。数据缺失常因动态传播趋势(即与假新闻相关的帖子数在引起公众关注前缓慢增长)而发生。我们提出一种新颖的鲁棒域与跨模态方法(RDCM)用于多模态错误信息检测。它通过域间对齐模块对齐文本与视觉模态的联合分布以减小域偏移,并通过跨模态对齐模块弥合两模态间的语义鸿沟。我们还提出一个同时考虑域泛化(目标域数据不可用)与域适应(无标注目标域数据可用)应用场景的框架。在两个公开多模态错误信息检测数据集(Pheme 与 Twitter Datasets)上的评估结果证明了所提模型的优越性。本文的正式实现可在此链接找到:https://github.com/less-and-less-bugs/RDCM

关键词

引用

@article{arxiv.2311.14315,
  title  = {Robust Domain Misinformation Detection via Multi-modal Feature Alignment},
  author = {Hui Liu and Wenya Wang and Hao Sun and Anderson Rocha and Haoliang Li},
  journal= {arXiv preprint arXiv:2311.14315},
  year   = {2023}
}

备注

Accepted by TIFS 2023