基于条件Fréchet距离评估文本到图像与文本到视频合成
计算机视觉与模式识别
2025-08-28 v2
摘要
评估文本到图像和文本到视频模型具有挑战性,因为存在根本性的断层:既有的评估指标未能同时衡量视觉质量与文本语义对齐,导致与人类判断的相关性较差。为此,我们提出cFreD(Conditional Fréchet Distance),一种基于条件Fréchet距离的通用指标,将视觉保真度与文本提示一致性统一为单一分数。现有指标如Fréchet Inception Distance(FID)衡量图像质量,但忽略文本条件;对齐评分如CLIPScore则对视觉质量不敏感。此外,学习型偏好模型需要不断重新训练,难以适应新型架构或分布外提示。通过在多个最新文本到图像模型和多样化提示数据集上进行大量实验,cFreD在与人类判断的相关性方面优于统计指标,包括使用人类偏好训练的指标。我们的发现表明,cFreD是一种稳健且面向未来可持续的评估指标,用于系统性评估文本条件化模型,标准化该快速发展领域的基准测试。我们发布了评估工具包和基准数据集。
引用
@article{arxiv.2503.21721,
title = {Evaluating Text-to-Image and Text-to-Video Synthesis with a Conditional Fr\'{e}chet Distance},
author = {Jaywon Koo and Jefferson Hernandez and Moayed Haji-Ali and Ziyan Yang and Vicente Ordonez},
journal= {arXiv preprint arXiv:2503.21721},
year = {2025}
}
备注
Added new video experiments and more image experiments to validate the method