SeqDialN:联合视觉-语言表示空间中的序列视觉对话网络
摘要
在本工作中,我们将视觉对话形式化为一种信息流,其中每条信息都用单轮对话的联合视觉-语言表示进行编码。基于这一形式化,我们将视觉对话任务视为由有序视觉-语言向量组成的序列问题。在特征化方面,我们使用密集对称协同注意力网络作为轻量级视觉-语言联合表示生成器来融合多模态特征(即图像和文本),从而获得更好的计算与数据效率。在推理方面,我们提出两种序列对话网络(SeqDialN):第一种使用 LSTM 进行信息传播(IP),第二种使用改进的 Transformer 进行多步推理(MR)。我们的架构将多模态特征融合的复杂性与推理的复杂性分离,从而允许更简单的推理引擎设计。基于 IP 的 SeqDialN 是我们的基线,采用简单的 2 层 LSTM 设计,取得了不错的性能。另一方面,基于 MR 的 SeqDialN 通过 Transformer 的自注意力栈递归地精炼语义问题/历史表示,并在视觉对话任务上产生了有前景的结果。在 VisDial v1.0 test-std 数据集上,我们最佳的单一生成式 SeqDialN 取得了 62.54% NDCG 和 48.63% MRR;我们的集成生成式 SeqDialN 取得了 63.78% NDCG 和 49.98% MRR,确立了新的最先进生成式视觉对话模型。我们使用密集标注对判别式 SeqDialN 进行微调,将性能提升至 72.41% NDCG 和 55.11% MRR。在本工作中,我们讨论了为证明模型组件有效性而进行的广泛实验,并提供了来自相关对话轮的推理过程可视化以及微调方法讨论。我们的代码可在 https://github.com/xiaoxiaoheimei/SeqDialN 获取。
引用
@article{arxiv.2008.00397,
title = {SeqDialN: Sequential Visual Dialog Networks in Joint Visual-Linguistic Representation Space},
author = {Liu Yang},
journal= {arXiv preprint arXiv:2008.00397},
year = {2022}
}
备注
This submission has been withdrawn by arXiv administrators due to an unresolvable authorship dispute