中文

面向视频接地对话的信息论文本幻觉削减

计算与语言 2023-10-10 v1 计算机视觉与模式识别

摘要

视频接地对话(VGD)旨在针对给定视频与对话上下文,解码出某问题的答案句。尽管多模态推理在生成答案句方面近期取得进展,现有对话系统仍受文本幻觉问题困扰,即在不理解问题的情况下从输入文本中盲目复制文本。这是由于数据集中答案句通常包含输入文本的词汇,系统由此学到虚假关联,从而过度依赖从输入文本复制词汇以期望与真实文本重叠。为此,我们设计了文本幻觉缓解(THAM)框架,其融合了由所提信息论文本幻觉度量方法导出的文本幻觉正则化(THR)损失。将 THAM 应用于当前对话系统,验证了其在 VGD 基准(即 AVSD@DSTC7 与 AVSD@DSTC8)上的有效性,并展现出增强的可解释性。

关键词

引用

@article{arxiv.2212.05765,
  title  = {Information-Theoretic Text Hallucination Reduction for Video-grounded Dialogue},
  author = {Sunjae Yoon and Eunseop Yoon and Hee Suk Yoon and Junyeong Kim and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2212.05765},
  year   = {2023}
}

备注

12 pages, Accepted in EMNLP 2022