Sora Detector:用于大型文本到视频模型的统一幻觉检测框架
机器学习
2024-05-08 v1 计算机视觉与模式识别
摘要
文本到视频 (T2V) 生成模型的快速发展使我们能够合成由文本描述引导的高保真视频内容。尽管取得了显著进展,这些模型常常容易受到幻觉影响,即生成与输入文本相矛盾的内容,这对其可靠性和实际部署构成挑战。为解决此关键问题,本文引入 SoraDetector,这是一个 novel 的统一框架,用于检测各种大型 T2V 模型(包括最先进的 Sora 模型)中的幻觉。我们的框架基于对幻觉现象的全面分析,依据其在视频内容中的表现进行分类。利用最先进的关键帧提取技术和多模态大语言模型,SoraDetector 首先评估提取的视频内容摘要与文本提示之间的一致性,然后从帧中构建静态和动态知识图谱 (KGs),以检测单个帧内以及跨帧的幻觉。Sora Detector 提供了关于一致性、静态和动态幻觉的稳健且可量化的衡量标准。此外,我们开发了 Sora Detector Agent 以自动化幻觉检测过程并为每个输入视频生成完整的视频质量报告。最后,我们提出了一个新的 meta-评估基准 T2VHaluBench,仔细构建以促进 T2V 幻觉检测领域进展的评估。通过在 Sora 及其他大型 T2V 模型生成的视频上进行大量实验,我们展示了该方法在准确检测幻觉方面的有效性。代码和数据集可通过 GitHub 访问。
引用
@article{arxiv.2405.04180,
title = {Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models},
author = {Zhixuan Chu and Lei Zhang and Yichen Sun and Siqiao Xue and Zhibo Wang and Zhan Qin and Kui Ren},
journal= {arXiv preprint arXiv:2405.04180},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2306.08302, arXiv:2403.05131 by other authors