M2K-VDG:模型自适应多模态知识锚点增强的视频对话生成
计算与语言
2024-02-20 v1
摘要
视频对话生成(VDG)要求系统基于多模态知识生成流畅且准确的答案。然而,多模态知识利用的困难在实践中给VDG模型带来了严重的幻觉。尽管先前的工作以多种方式缓解了幻觉,但它们几乎没有注意到多模态知识锚点答案令牌的重要性。本文通过困惑度揭示,不同的VDG模型经历不同的幻觉并表现出不同的锚点令牌。基于这一观察,我们提出了M2K-VDG,一种用于减少幻觉的模型自适应多模态知识锚点增强框架。此外,我们引入了反事实效应以实现更准确的锚点令牌检测。在三个流行基准上的实验结果表明,我们的方法优于最先进的方法,证明了其在减少幻觉方面的有效性。
引用
@article{arxiv.2402.11875,
title = {M2K-VDG: Model-Adaptive Multimodal Knowledge Anchor Enhanced Video-grounded Dialogue Generation},
author = {Hongcheng Liu and Pingjie Wang and Yu Wang and Yanfeng Wang},
journal= {arXiv preprint arXiv:2402.11875},
year = {2024}
}