感知、理解与推理:面向视频假新闻检测的多模态基准
计算机视觉与模式识别
2026-01-21 v2 人工智能
摘要
多模态大语言模型(MLLMs)的出现极大推动了视频假新闻检测(VFND)任务的研究。现有基准通常关注检测准确率,未能为整个检测过程提供细粒度评估。为解决此限制,我们引入了 POVFNDB(Process-oriented Video Fake News Detection Benchmark),一个以过程为导向的基准,包含 10 项任务,用于系统性评估 MLLMs 在 VFND 中的感知、理解和推理能力。该基准包含 36,240 项人工标注的问答(QA)数据,以结构化或开放式格式呈现,涵盖 15 个不同评估维度,以刻画视频假新闻检测过程的不同方面。通过 POVFNDB,我们对 proprietary 和开源 MLLMs 进行了全面评估。此外,我们通过微调 Qwen2.5VL-7B-Instruct 于我们提出的 POVFND-CoT 框架构建的过程导向链式思考数据,建立了 VFND 强基准基线,实现了该任务的最新性能。
引用
@article{arxiv.2510.24816,
title = {Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection},
author = {Cui Yakun and Peng Qi and Fushuo Huo and Hang Du and Weijie Shi and Juntao Dai and Zhenghao Zhu and Sirui Han and Yike Guo},
journal= {arXiv preprint arXiv:2510.24816},
year = {2026}
}