多模态假新闻视频解释:数据集、分析与评估
计算机视觉与模式识别
2025-04-18 v3 多媒体
摘要
多模态假新闻视频难以解释,因为需要综合考虑多个模态之间的相关性和一致性。现有方法将假新闻视频视为分类问题,但尚不清楚为何会将新闻视频识别为假新闻。没有 proper explanation,end user 可能无法理解虚假性的 underlying meaning。因此,我们提出了新问题——假新闻视频解释(FNVE)——给定包含视频和标题的多模态新闻帖子,我们目标是生成自然语言解释,以揭示新闻视频的虚假性。为此,我们开发了 FakeVE,即一个包含 2,672 个可 definitively 解释四种真实生活假新闻视频方面的假新闻视频帖子的数据集。为理解假新闻视频解释的特征,我们从不同角度对 FakeVE 进行了探索性分析。此外,我们提出一种基于多模态 Transformer 架构的 Multimodal Relation Graph Transformer(MRGT),用于基准 FakeVE。实验结果表明,various benchmarks(采用 FakeVE)的结果令人信服,并对比分析了不同基准模型在解释生成方面的差异。
关键词
引用
@article{arxiv.2501.08514,
title = {Multimodal Fake News Video Explanation: Dataset, Analysis and Evaluation},
author = {Lizhi Chen and Zhong Qian and Peifeng Li and Qiaoming Zhu},
journal= {arXiv preprint arXiv:2501.08514},
year = {2025}
}