模型产生幻觉:视频描述中的事实性评估
计算机视觉与模式识别
2023-03-07 v1
摘要
视频描述旨在用自然语言描述视频中的事件。近年来,许多工作聚焦于提升描述模型的性能。然而,与其他文本生成任务一样,它存在引入输入视频不支持的事实错误的风险。这些事实错误会严重影响生成文本的质量,有时使其完全不可用。尽管事实一致性在文本到文本任务(如摘要)中已受到大量研究关注,但在基于视觉的文本生成背景下研究较少。本工作中,我们对视频描述中的事实性进行了详细的人工评估,并收集了两个标注事实性数据集。我们发现 57.0% 的模型生成句子存在事实错误,表明这是该领域的一个严重问题。然而,现有评估指标主要基于 n-gram 匹配,与人工事实性标注相关性很小。我们进一步提出了一种弱监督的、基于模型的事实性指标 FactVC,其在视频描述的事实性评估上优于先前指标。数据集与指标将被发布以促进视频描述的未来研究。
引用
@article{arxiv.2303.02961,
title = {Models See Hallucinations: Evaluating the Factuality in Video Captioning},
author = {Hui Liu and Xiaojun Wan},
journal= {arXiv preprint arXiv:2303.02961},
year = {2023}
}
备注
17 pages