中文

基于双知识增强生成式预训练语言模型的多模态对话系统

计算与语言 2024-05-14 v2 人机交互 多媒体

摘要

面向多模态任务型对话系统的文本回复生成旨在给定多模态上下文的情况下生成恰当文本回复,是一项关键且具有挑战性的任务。尽管现有研究已取得令人瞩目的成功,但仍存在两个关键局限:1) 忽视生成式预训练的优势;2) 忽略与文本上下文相关的知识。为应对这些局限,我们提出一种用于多模态任务型对话系统的新颖双知识增强生成式预训练语言模型(DKMD),其由三个关键组件构成:双知识选择、双知识增强上下文学习以及知识增强回复生成。具体而言,双知识选择组件旨在根据给定上下文的文本与视觉模态选择相关知识。此后,双知识增强上下文学习组件从全局与局部两个视角将所选知识无缝整合进多模态上下文学习中,并在此过程中探索跨模态语义关系。此外,知识增强回复生成组件包含一个改进的 BART 解码器,其中引入了额外的点积知识-解码器注意力子层,以显式利用知识来推进文本回复生成。在公开数据集上的大量实验验证了所提 DKMD 相对于最先进对比方法的优越性。

关键词

引用

@article{arxiv.2207.07934,
  title  = {Multimodal Dialog Systems with Dual Knowledge-enhanced Generative Pretrained Language Model},
  author = {Xiaolin Chen and Xuemeng Song and Liqiang Jing and Shuo Li and Linmei Hu and Liqiang Nie},
  journal= {arXiv preprint arXiv:2207.07934},
  year   = {2024}
}