中文

面向视频字幕的幻觉问题思考

计算机视觉与模式识别 2022-09-29 v1

摘要

随着丰富视觉表示和预训练语言模型的出现,视频字幕的质量随时间不断提升。尽管性能有所改善,视频字幕模型仍容易出现幻觉。幻觉是指生成与源材料脱离的高度病态描述。在视频字幕中,存在两种幻觉:物体幻觉和动作幻觉。本文不致力于学习更好的视频表示,而是探究幻觉问题的根本来源。我们确定了三个主要因素:(i)从预训练模型中提取的视觉特征不足,(ii)多模态融合过程中源上下文与目标上下文的不当影响,以及(iii)训练策略中的暴露偏差。为缓解这些问题,我们提出两种鲁棒解决方案:(a)在提取的视觉特征之上以多标签设置训练辅助头,以及(b)添加上下文门,在融合过程中动态选择特征。视频字幕的标准评估指标衡量与真实字幕的相似度,不能充分捕捉物体和动作相关性。为此,我们提出一个新指标 COAHA(字幕物体与动作幻觉评估,caption object and action hallucination assessment),用于评估幻觉程度。我们的方法在 MSR-Video to Text(MSR-VTT)和 Microsoft Research Video Description Corpus(MSVD)数据集上取得了最先进的性能,尤其在 CIDEr 分数上以巨大优势领先。

关键词

引用

@article{arxiv.2209.13853,
  title  = {Thinking Hallucination for Video Captioning},
  author = {Nasib Ullah and Partha Pratim Mohanta},
  journal= {arXiv preprint arXiv:2209.13853},
  year   = {2022}
}

备注

18 pages