中文

通过多轮对话中的迭代对象-实体对齐提升视觉对话状态跟踪

人工智能 2024-08-14 v1 计算与语言 计算机视觉与模式识别

摘要

视觉对话(VD)是一种任务,其中智能体需基于多轮对话历史回答一系列与图像相关的问题。然而,先前的 VD 方法常将整个对话历史视为简单文本输入,忽视了在轮次层面所蕴含的对话信息流。本文引入一种多轮对话状态跟踪模型(MDST),以解决这一局限性,利用从对话历史中学习的对话状态来回答问题。MDST 捕获每一轮的对话历史,构建定义为视觉-语言表示 2 元组的内部对话状态表示。这些表示有效地将当前问题对齐,从而实现准确答案的生成。在 VisDial v1.0 数据集上的实验结果表明,MDST 在生成式设置下实现了新的状态-of-the-art 性能。此外,通过一系列人类研究,我们验证了 MDST 在生成长篇连贌且符合人类语言习惯的答案方面的有效性,同时能够正确回答一系列问题。

关键词

引用

@article{arxiv.2408.06725,
  title  = {Enhancing Visual Dialog State Tracking through Iterative Object-Entity Alignment in Multi-Round Conversations},
  author = {Wei Pang and Ruixue Duan and Jinfu Yang and Ning Li},
  journal= {arXiv preprint arXiv:2408.06725},
  year   = {2024}
}

备注

This article has been accepted in CAAI Transactions on Intelligence Technology! Article ID: CIT2_12370, Article DOI: 10.1049/cit2.12370