中文

DAM:用于视觉对话中生成详尽且无重复响应的审慎、舍弃与记忆网络

计算机视觉与模式识别 2020-07-08 v1 计算与语言

摘要

视觉对话任务要求智能体就一幅图像与人类进行对话。生成详尽且无重复响应的能力对于智能体实现类人对话至关重要。在本文中,我们提出一种新颖的生成式解码架构来生成高质量响应,该架构脱离了对整体编码语义的解码,转向倡导透明性与灵活性的设计。在此架构中,词语生成被分解为一系列基于注意力的信息选择步骤,由新颖的循环式审慎、舍弃与记忆(DAM)模块执行。每个 DAM 模块对从编码器捕获的响应级语义与专为生成每个词而选定的词级语义进行自适应组合。因此,响应包含更详尽且无重复的描述,同时保持语义准确性。此外,DAM 可灵活地与现有视觉对话编码器协作,并通过约束 DAM 中的信息选择模式来适应编码器结构。我们将 DAM 应用于三种典型编码器,并在 VisDial v1.0 数据集上验证性能。实验结果表明,所提模型以高质量响应取得了新的最优(SOTA)性能。代码见 https://github.com/JXZe/DAM。

关键词

引用

@article{arxiv.2007.03310,
  title  = {DAM: Deliberation, Abandon and Memory Networks for Generating Detailed and Non-repetitive Responses in Visual Dialogue},
  author = {Xiaoze Jiang and Jing Yu and Yajing Sun and Zengchang Qin and Zihao Zhu and Yue Hu and Qi Wu},
  journal= {arXiv preprint arXiv:2007.03310},
  year   = {2020}
}

备注

Accepted by IJCAI 2020. SOLE copyright holder is IJCAI (International Joint Conferences on Artificial Intelligence)