中文

ETVA:基于细粒度问答生成的文本到视频对齐评估

计算机视觉与模式识别 2025-08-19 v2

摘要

精确评估文本提示与生成视频之间的语义对齐在文本到视频(T2V)生成中仍是一个挑战。现有的文本到视频对齐指标如CLIPScore仅生成粗粒度分数,无法提供细粒度对齐细节,无法与人类偏好一致。为解决这一局限性,我们提出了ETVA—a一种通过细粒度问答生成来评估文本到视频对齐的方法。首先,一个多智能体系统将提示解析为语义场景图,以生成原子问题。然后我们设计了一个知识增强的多阶段推理框架进行问答,其中一个辅助LLM首先检索相关常识知识(如物理法则),然后视频LLM通过多阶段推理机制回答生成的问题。大量实验表明,ETVA实现了58.47的斯皯曼相关系数,显著高于现有指标仅达到31.0的相关性。我们还构建了一个专为文本到视频对齐评估设计的综合基准,包含2000个多样化提示和12000个跨10个类别的原子问题。通过系统评估15个现有文本到视频模型,我们识别了其关键能力与局限,为下一代T2V生成铺平了道路。

关键词

引用

@article{arxiv.2503.16867,
  title  = {ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering},
  author = {Kaisi Guan and Zhengfeng Lai and Yuchong Sun and Peng Zhang and Wei Liu and Kieran Liu and Meng Cao and Ruihua Song},
  journal= {arXiv preprint arXiv:2503.16867},
  year   = {2025}
}

备注

International Conference on Computer Vision 2025