中文

ViMGuard:面向视频虚假信息防护的多模态系统

机器学习 2024-10-23 v1 计算与语言 计算机与社会

摘要

社交媒体和短视频 (short-form video, SFV) 的兴起为虚假信息的传播提供了温床。随着大规模语言模型的出现,大量研究致力于通过自动化手段检测文本虚假主张以遏制此问题。然而,SFV的虚假信息自动检测仍是一项更为复杂且鲜有人问的问题。虽然文本样本单一 (仅包含文字),但SFV包含三种不同模态:文字、视觉和非语言音频。本文引入视频遮盖自编码器用于虚假信息防护 (Video Masked Autoencoders for Misinformation Guarding, ViMGuard),这是首个能够通过分析SFV三种组成要素来 fact-check 的深度学习架构。ViMGuard 采用双组件系统:首先,视频和音频遮盖自编码器分析SFV的视觉与非语言音频元素,以 discern 其意图——具体而言,即其是否旨在传递信息性主张。若判定该SFV具有信息性意图,则传递至第二个组件:基于检索增强生成 (retrieval-augmented generation) 的系统,用于验证 spoken words 的事实准确性。在评估中,ViMGuard 在三个前沿事实核查工具之上显著超越,设立了SFV事实核查的新标准,标志着可信社交平台新闻的重要进步。为促进进一步测试与迭代,ViMGuard 被部署为 Chrome 插件,并在 GitHub 上开源全部代码。

关键词

引用

@article{arxiv.2410.16592,
  title  = {ViMGuard: A Novel Multi-Modal System for Video Misinformation Guarding},
  author = {Andrew Kan and Christopher Kan and Zaid Nabulsi},
  journal= {arXiv preprint arXiv:2410.16592},
  year   = {2024}
}

备注

7 pages, 2 figures