中文

基于形式化验证的文本到视频模型神经符号评估

计算机视觉与模式识别 2025-04-28 v5 人工智能

摘要

近期文本到视频模型(如 Sora、Gen-3、MovieGen 和 CogVideoX)的快速发展正在推动合成视频生成的边界,其应用领域包括机器人、自动驾驶和娱乐等。随着这些模型的普及,各种指标和基准涌现出来,用于评估生成视频的质量。然而,这些指标强调视觉质量和平滑度,忽略了时间保真度和文本到视频对齐问题,这在安全关键应用中至关重要。为此,我们引入了 NeuS-V,一种新型的合成视频评估指标,通过神经符号形式化验证技术严格评估文本到视频对齐。我们的方法首先将提示转换为形式化定义的时间逻辑 (TL) 规范,然后将生成的视频翻译为自动机表示。随后,通过形式化检查视频自动机与 TL 规范之间的关系来评估文本到视频对齐。此外,我们构建了一个由时间扩展提示组成的数据集,用于评估最先进的视频生成模型以衡量我们的基准。我们发现,NeuS-V 与人类评估的相关性比现有指标高出 5 倍。我们的评估进一步表明,当前的视频生成模型在这些时间复杂提示方面表现不佳,这凸显了在提高文本到视频生成能力方面的未来工作的必要性。

关键词

引用

@article{arxiv.2411.16718,
  title  = {Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification},
  author = {S P Sharan and Minkyu Choi and Sahil Shah and Harsh Goel and Mohammad Omama and Sandeep Chinchali},
  journal= {arXiv preprint arXiv:2411.16718},
  year   = {2025}
}