中文

探索音频在多模态虚假信息检测中的作用

多媒体 2024-08-23 v1

摘要

随着深度伪造技术,尤其是深度音频伪造技术的快速发展,社交媒体上的虚假信息检测正面临巨大挑战。社交媒体数据常包含音频、视频、文本和图像等多模态信息。然而,现有的多模态虚假信息检测方法往往仅关注其中一些模态,无法全面覆盖所有模态的信息。为全面应对社交媒体中可能出现的各种模态信息,本文构建了一个综合性的多模态虚假信息检测框架。通过为每种模态采用相应的神经网络编码器,该框架能够融合不同模态的信息,并支持多模态虚假信息检测任务。基于构建的框架,本文探讨了音频模态在社交媒体多模态虚假信息检测任务中的重要性。通过调整声学编码器的架构,研究了不同声学特征编码器在多模态虚假信息检测任务中的有效性。此外,本文发现,音频和视频信息必须仔细对齐,否则不同音频和视频模态之间的错位会严重损害模型性能。

关键词

引用

@article{arxiv.2408.12558,
  title  = {Exploring the Role of Audio in Multimodal Misinformation Detection},
  author = {Moyang Liu and Yukun Liu and Ruibo Fu and Zhengqi Wen and Jianhua Tao and Xuefei Liu and Guanjun Li},
  journal= {arXiv preprint arXiv:2408.12558},
  year   = {2024}
}