FIFA:用于文本到视频和视频到文本生成的统一忠实性评估框架
计算机视觉与模式识别
2025-07-10 v1 计算与语言
图形学
摘要
视频多模态大语言模型(VideoMLLMs)在文本到视频和视频到文本任务中取得了显著进展。然而,它们常因幻觉现象而受限,即生成与视觉输入相矛盾的内容。现有评估方法局限于单一任务(例如 V2T),且未能评估开放式、自由形式响应中的幻觉。为此,我们提出了 FIFA(FaIthFulness evAluation framework),一个统一的忠实性评估框架,从中提取全面描述性事实,通过时空语义依赖图建模其语义依赖关系,并使用 VideoQA 模型进行验证。我们进一步引入 Post-Correction,一个基于工具的纠正框架,对幻觉内容进行修订。广泛的实验表明,FIFA 更贴近人类判断,而 Post-Correction 有效改进了文本和视频生成中的事实一致性。
引用
@article{arxiv.2507.06523,
title = {FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation},
author = {Liqiang Jing and Viet Lai and Seunghyun Yoon and Trung Bui and Xinya Du},
journal= {arXiv preprint arXiv:2507.06523},
year = {2025}
}