面向视频接地对话的信息论文本幻觉削减
计算与语言
2023-10-10 v1 计算机视觉与模式识别
摘要
视频接地对话(VGD)旨在针对给定视频与对话上下文,解码出某问题的答案句。尽管多模态推理在生成答案句方面近期取得进展,现有对话系统仍受文本幻觉问题困扰,即在不理解问题的情况下从输入文本中盲目复制文本。这是由于数据集中答案句通常包含输入文本的词汇,系统由此学到虚假关联,从而过度依赖从输入文本复制词汇以期望与真实文本重叠。为此,我们设计了文本幻觉缓解(THAM)框架,其融合了由所提信息论文本幻觉度量方法导出的文本幻觉正则化(THR)损失。将 THAM 应用于当前对话系统,验证了其在 VGD 基准(即 AVSD@DSTC7 与 AVSD@DSTC8)上的有效性,并展现出增强的可解释性。
引用
@article{arxiv.2212.05765,
title = {Information-Theoretic Text Hallucination Reduction for Video-grounded Dialogue},
author = {Sunjae Yoon and Eunseop Yoon and Hee Suk Yoon and Junyeong Kim and Chang D. Yoo},
journal= {arXiv preprint arXiv:2212.05765},
year = {2023}
}
备注
12 pages, Accepted in EMNLP 2022