中文

Sora生成视频中的简单视觉伪影检测

计算机视觉与模式识别 2025-05-01 v1

摘要

OpenAI的Sora于2024年12月发布,这是一个由自然语言提示驱动的强大视频生成模型,突显了大语言模型(LLM)与视频合成之间日益增长的融合。随着这些多模态系统发展为能够解释、生成和交互视觉内容的视频大语言模型(VidLLMs),理解其局限性并确保其安全部署变得至关重要。本研究调查了Sora生成视频中常见的视觉伪影,这些伪影可能损害质量、误导观众或传播错误信息。我们提出了一个针对四种常见伪影标签类型的多标签分类框架:标签1:边界/边缘缺陷,标签2:纹理/噪声问题,标签3:运动/关节异常,标签4:物体不匹配/消失。使用从15个Sora生成视频中提取的300帧手动标注数据集,我们训练了多种2D CNN架构(ResNet-50、EfficientNet-B3/B4、ViT-Base)。由ResNet-50训练的最佳模型达到了平均多标签分类准确率94.14%。本研究通过(1)创建视频质量评估数据集,(2)超越语言指标的可解释伪影分析,以及(3)识别与事实性和安全性相关的视觉风险,为VidLLMs的更广泛发展做出了贡献。

关键词

引用

@article{arxiv.2504.21334,
  title  = {Simple Visual Artifact Detection in Sora-Generated Videos},
  author = {Misora Sugiyama and Hirokatsu Kataoka},
  journal= {arXiv preprint arXiv:2504.21334},
  year   = {2025}
}