STREAM:面向视频生成模型的时空评估分析指标
计算机视觉与模式识别
2024-04-01 v3 人工智能
摘要
图像生成模型在生成逼真且多样化的图像方面取得了显著进展,这得益于来自各种评估指标的全面指导。然而,当前的视频生成模型在生成即使是短短的视频片段时也面临挑战,缺乏为改进提供见解的工具。当前的视频评估指标是简单地将图像指标通过更换嵌入为视频嵌入网络来适应,这可能低估了视频特有的特征。我们的分析表明,广泛使用的 Frechet Video Distance (FVD) 对空间方面比视频的时序自然性更强,并且受制于所用嵌入网络的输入大小,限制为 16 帧。此外,它显示出显著的不稳定性,与人类评估存在偏差。为解决这些限制,我们提出了 STREAM,一种全新设计的视频评估指标,独立评估时空方面。该特性允许从各种角度全面分析和评估视频生成模型,受视频长度限制。我们提供的分析性和实验证据表明,STREAM 为视频的视觉和时序质量提供了有效的评估工具,为视频生成模型的改进领域提供了洞见。据我们所知,STREAM 是第一个能够分别评估视频时空方面的评估指标。我们的代码已公开于 https://github.com/pro2nit/STREAM。
引用
@article{arxiv.2403.09669,
title = {STREAM: Spatio-TempoRal Evaluation and Analysis Metric for Video Generative Models},
author = {Pum Jun Kim and Seojun Kim and Jaejun Yoo},
journal= {arXiv preprint arXiv:2403.09669},
year = {2024}
}
备注
Our work is accepted to ICLR 2024