中文

FIFA:用于文本到视频和视频到文本生成的统一忠实性评估框架

计算机视觉与模式识别 2025-07-10 v1 计算与语言 图形学

摘要

视频多模态大语言模型(VideoMLLMs)在文本到视频和视频到文本任务中取得了显著进展。然而,它们常因幻觉现象而受限,即生成与视觉输入相矛盾的内容。现有评估方法局限于单一任务(例如 V2T),且未能评估开放式、自由形式响应中的幻觉。为此,我们提出了 FIFA(FaIthFulness evAluation framework),一个统一的忠实性评估框架,从中提取全面描述性事实,通过时空语义依赖图建模其语义依赖关系,并使用 VideoQA 模型进行验证。我们进一步引入 Post-Correction,一个基于工具的纠正框架,对幻觉内容进行修订。广泛的实验表明,FIFA 更贴近人类判断,而 Post-Correction 有效改进了文本和视频生成中的事实一致性。

关键词

引用

@article{arxiv.2507.06523,
  title  = {FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation},
  author = {Liqiang Jing and Viet Lai and Seunghyun Yoon and Trung Bui and Xinya Du},
  journal= {arXiv preprint arXiv:2507.06523},
  year   = {2025}
}