VMID:用于检测和识别短视频误导信息的多模态融合大语言模型框架
计算机视觉与模式识别
2024-11-18 v1 人工智能
摘要
短视频平台已成为新闻传播的重要渠道,为用户获取时事和分享信息提供了高度吸引人且即时的方式。然而,这些平台也成为了误导信息快速传播的重要管道,因为虚假新闻和谣言可利用短视频的视觉吸引力和广泛传播范围在受众中大量流通。现有的假新闻检测方法主要依赖单模态信息(如文本或图像),或仅采用基础融合技术,限制了其处理短视频固有的复杂、多层次信息的能力。为解决这些局限,本文提出了一种基于多模态信息的新型假新闻检测方法,旨在通过对视频内容的多层次分析来识别误导信息。该方法有效利用不同模态表征生成统一的文本描述,再输入大语言模型进行综合评估。所提框架成功融合视频内的多模态特征,显著提升了假新闻检测的准确性和可靠性。实验结果表明,该方法在准确性、鲁棒性和多模态信息利用方面优于现有模型,准确率达 90.93%,显著高于最佳基线模型(SV-FEND)的 81.05%。此外,案例研究进一步证明了该方法在准确区分假新闻、辟谣内容和真实事件方面的有效性,凸显了其在实际应用中的可靠性和鲁棒性。
引用
@article{arxiv.2411.10032,
title = {VMID: A Multimodal Fusion LLM Framework for Detecting and Identifying Misinformation of Short Videos},
author = {Weihao Zhong and Yinhao Xiao and Minghui Xu and Xiuzhen Cheng},
journal= {arXiv preprint arXiv:2411.10032},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2211.10973 by other authors