ViBe:用于评估大型多模态模型中幻觉的文本到视频基准
计算机视觉与模式识别
2025-03-21 v2 人工智能
摘要
大型多模态模型(LMMs)的最新进展已将其能力扩展到视频理解领域,其中文本到视频(T2V)模型在根据文本提示生成视频方面表现出色。然而,它们仍然频繁产生幻觉内容,暴露出 AI 生成的不一致性。我们引入了 ViBe (https://vibe-t2v-bench.github.io/):一个包含来自开源 T2V 模型幻觉视频的大规模数据集。我们识别了五种主要的幻觉类型:主体消失、遗漏错误、数值变异、主体畸形和视觉不一致。使用十个 T2V 模型,我们从 837 个多样化的 MS COCO 描述中生成并手动标注了 3,782 个视频。我们提出的基准包括一个幻觉视频数据集和一个使用视频嵌入的分类框架。ViBe 作为评估 T2V 可靠性和推进幻觉检测的关键资源。我们将分类确立为基线,其中 TimeSFormer + CNN 集成取得了最佳性能(0.345 准确率,0.342 F1 分数)。虽然提出的初始基线仅取得了适中的准确率,但这凸显了自动化幻觉检测的困难以及对改进方法的需求。我们的研究旨在推动更鲁棒的 T2V 模型的开发,并根据用户偏好评估其输出。
引用
@article{arxiv.2411.10867,
title = {ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models},
author = {Vipula Rawte and Sarthak Jain and Aarush Sinha and Garv Kaushik and Aman Bansal and Prathiksha Rumale Vishwanath and Samyak Rajesh Jain and Aishwarya Naresh Reganti and Vinija Jain and Aman Chadha and Amit P. Sheth and Amitava Das},
journal= {arXiv preprint arXiv:2411.10867},
year = {2025}
}