频域对多模态表示与融合更有效:一种多模态频谱谣言检测器
多媒体
2023-12-19 v1 人工智能
摘要
多模态内容,例如文本与图像的混合,给社交媒体中的谣言检测带来了重大挑战。现有的多模态谣言检测侧重于在空间和序列位置之间混合标记以进行单模态表示,或跨模态融合谣言真实性的线索。然而,它们遭受较差的判别性单模态表示,并且在空间和序列标记的耗时融合中容易受到复杂位置依赖性的影响。本文首次尝试在频域进行多模态谣言检测,该检测有效地将空间特征转换为频谱,并为多模态表示和融合获得高度判别性的频谱特征。一种新颖的频域表示与融合网络(FSRU)结合双对比学习揭示了频域对多模态表示和融合更有效,提取了用于谣言检测的信息成分。FSRU包含三种新颖机制:利用傅里叶变换将空间域特征转换为频域特征、单模态频谱压缩以及频域中的跨模态频谱共选择模块。大量实验表明,FSRU取得了令人满意的多模态谣言检测性能。
引用
@article{arxiv.2312.11023,
title = {Frequency Spectrum is More Effective for Multimodal Representation and Fusion: A Multimodal Spectrum Rumor Detector},
author = {An Lao and Qi Zhang and Chongyang Shi and Longbing Cao and Kun Yi and Liang Hu and Duoqian Miao},
journal= {arXiv preprint arXiv:2312.11023},
year = {2023}
}
备注
12 pages, AAAI-2024