SST-EM:用于评估视频编辑中语义、空间与时间特性的高级指标
计算机视觉与模式识别
2025-01-14 v1 计算与语言
摘要
视频编辑模型已取得显著进展,但评估其性能仍具挑战性。传统指标(如 CLIP 文本和图像分数)通常存在不足:文本分数受限于训练数据不足和层级依赖性,而图像分数无法评估时间一致性。我们提出了 SST-EM(语义、空间与时间评估指标,Semantic, Spatial, and Temporal Evaluation Metric),这是一种利用现代视觉语言模型(VLM)、目标检测和时间一致性检查的新型评估框架。SST-EM 包含四个组件:(1) 使用 VLM 从帧中提取语义,(2) 通过目标检测进行主要目标跟踪,(3) 利用 LLM 智能体进行聚焦目标细化,以及 (4) 使用视觉 Transformer(ViT)进行时间一致性评估。这些组件被整合为一个统一指标,其权重源自人类评估和回归分析。SST-EM 这一名称反映了其对视频评估中语义、空间和时间特性的关注。SST-EM 对视频编辑中的语义保真度和时间平滑度提供了全面评估。源代码可在 \textbf{\href{https://github.com/custommetrics-sst/SST_CustomEvaluationMetrics.git}{GitHub Repository}} 获取。
引用
@article{arxiv.2501.07554,
title = {SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing},
author = {Varun Biyyala and Bharat Chanderprakash Kathuria and Jialu Li and Youshan Zhang},
journal= {arXiv preprint arXiv:2501.07554},
year = {2025}
}
备注
WACV workshop