用于视觉对话的带非似然训练的统一多模态模型
计算与语言
2022-11-28 v1 人工智能
计算机视觉与模式识别
摘要
视觉对话任务要求多模态聊天机器人回答人类关于图像内容的连续问题。先前工作在正例(含正确答案)上执行标准似然训练以生成答案。然而,似然目标常导致频繁且枯燥的输出,且未能从负例(含错误答案)中利用有用知识。本文提出一种带非似然训练的统一多模态模型,名为 UniMM-UL,以解决该问题。首先,为通过多任务学习改进视觉对话理解与生成,我们的模型扩展 ViLBERT,从仅支持答案判别无缝支持答案判别与答案生成,通过不同注意力掩码实现。具体而言,为使原始判别模型兼容答案生成,我们设计新颖生成式注意力掩码以实现自回归掩码语言建模(自回归 MLM)任务。为减轻似然目标的不利影响,我们在负例上利用非似然训练使模型更不可能生成错误答案。接着,为利用稠密标注,我们对生成与判别答案采用不同微调方法,而非如先前工作仅用于判别答案。最后,在 VisDial 数据集上,我们的模型取得最佳生成结果(69.23 NDCG 分数),并在单模型与集成设置下给出与最优判别结果可比的判别结果(75.92 与 76.17 NDCG 分数)。
引用
@article{arxiv.2211.13235,
title = {Unified Multimodal Model with Unlikelihood Training for Visual Dialog},
author = {Zihao Wang and Junli Wang and Changjun Jiang},
journal= {arXiv preprint arXiv:2211.13235},
year = {2022}
}
备注
Accepted by the 30th ACM International Conference on Multimedia (ACM MM 2022)