对话必须继续:通过生成式自训练改进视觉对话
计算机视觉与模式识别
2023-03-03 v2 计算与语言
机器学习
摘要
视觉对话(VisDial)是一项基于图像、利用对话历史作为上下文来回答一系列问题的任务。先前工作仅通过监督学习在VisDial数据上训练对话智能体,或利用相关视觉-语言数据集上的预训练。本文提出一种用于视觉接地对话的半监督学习方法,称为生成式自训练(GST),以利用网络上的无标注图像。具体而言,GST首先通过分布外检测检索域内图像,并通过多模态条件文本生成针对这些图像合成对话。GST随后在合成数据与原始VisDial数据上训练对话智能体。结果,GST将训练数据规模扩展到VisDial的一个数量级(1.2M至12.9M问答数据)。为对合成对话进行鲁棒训练,我们还提出了基于困惑度的数据选择与多模态一致性正则化。在VisDial v1.0和v0.9数据集上的评估表明,GST在两个数据集上均取得了新的最先进(SOTA)结果。我们进一步观察到GST对视觉与文本对抗攻击的鲁棒性。最后,GST在低数据量情形下带来了显著的性能提升。代码见 https://github.com/gicheonkang/gst-visdial。
引用
@article{arxiv.2205.12502,
title = {The Dialog Must Go On: Improving Visual Dialog via Generative Self-Training},
author = {Gi-Cheon Kang and Sungdong Kim and Jin-Hwa Kim and Donghyun Kwak and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2205.12502},
year = {2023}
}
备注
CVPR 2023