用于评估视频真实性的 3D 语义点自动编码器
计算机视觉与模式识别
2026-02-25 v1
摘要
AI 视频生成正快速发展。对于视频生成器要在从机器人到电影制作等应用领域中发挥作用,必须持续产生逼真的视频。然而,评估生成视频的真实性仍是主要依赖人工过程——需要人工标注或定制化评估数据集,但其适用范围受限。我们发展了一个自动化的视频真实性评估框架,捕捉语义和连贯的 3D 结构,无需参考视频。我们的方法是 3DSPA,即一种 3D 时空点自动编码器,将 3D 点轨迹、深度线索和 DINO 语义特征整合为统一的视频评估表示。3DSPA 模型对象如何移动以及场景中发生了什么,从而实现对真实性、时序一致性和物理合理性的稳健评估。实验表明,3DSPA 可可靠地识别违反物理法则的视频,对运动伪影更敏感,并在多个数据集上与人类对视频质量和真实性的判断更一致。我们的结果表明,丰富轨迹基表示的 3D 语义为为生成式视频模型提供更强的基准,隐式捕捉物理规则违反。代码和预训练模型权重将在 https://github.com/TheProParadox/3dspa_code 上提供。
引用
@article{arxiv.2602.20354,
title = {3DSPA: A 3D Semantic Point Autoencoder for Evaluating Video Realism},
author = {Bhavik Chandna and Kelsey R. Allen},
journal= {arXiv preprint arXiv:2602.20354},
year = {2026}
}