VU-BERT:一种用于视觉对话的统一框架
计算与语言
2022-02-23 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
视觉对话任务旨在训练一个智能体在给定图像的情况下回答多轮问题,这需要对图像与对话历史之间交互的深入理解。现有研究倾向于采用特定模态的模块来建模交互,这可能使用起来较为繁琐。为弥补这一不足,我们提出了一种用于图像-文本联合嵌入的统一框架,名为VU-BERT,并在视觉对话任务中首先应用图像块投影(patch projection)来获取视觉嵌入,以简化模型。该模型在两个任务上进行训练:掩码语言建模(masked language modeling)与下一轮话语检索(next utterance retrieval)。这些任务有助于学习视觉概念、话语依赖以及这两种模态之间的关系。最终,我们的VU-BERT在VisDial v1.0数据集上取得了具有竞争力的性能(NDCG分数为0.7287)。
引用
@article{arxiv.2202.10787,
title = {VU-BERT: A Unified framework for Visual Dialog},
author = {Tong Ye and Shijing Si and Jianzong Wang and Rui Wang and Ning Cheng and Jing Xiao},
journal= {arXiv preprint arXiv:2202.10787},
year = {2022}
}
备注
5 pages, 2 figures, accepted by 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2022)