Show, Adapt and Tell: 跨域图像描述器的对抗训练
计算机视觉与模式识别
2017-08-15 v2 人工智能
机器学习
摘要
在拥有大量训练图像-句子对(如 MSCOCO)的领域中,图像描述取得了令人印象深刻的成果。然而,迁移到具有显著领域偏移但无配对训练数据的目标域(称为跨域图像描述)在很大程度上仍未被探索。我们提出一种新颖的对抗训练过程,以利用目标域中的无配对数据。引入两个评判网络来引导描述器,即领域评判器和多模态评判器。领域评判器评估生成的句子是否与目标域中的句子不可区分。多模态评判器评估图像与其生成的句子是否为有效对。在训练期间,评判器与描述器充当对手——描述器旨在生成不可区分的句子,而评判器旨在区分它们。该评估通过策略梯度更新改进描述器。在推理期间,我们进一步提出一种基于评判器的规划方法,在无额外监督(如标签)的情况下选择高质量句子。为评估,我们使用 MSCOCO 作为源域,四个其他数据集(CUB-200-2011、Oxford-102、TGIF 和 Flickr30k)作为目标域。我们的方法在所有数据集上均表现良好。特别是在 CUB-200-2011 上,自适应后我们实现了 21.8% 的 CIDEr-D 提升。在推理中利用评判器进一步带来 4.5% 的提升。
引用
@article{arxiv.1705.00930,
title = {Show, Adapt and Tell: Adversarial Training of Cross-domain Image Captioner},
author = {Tseng-Hung Chen and Yuan-Hong Liao and Ching-Yao Chuang and Wan-Ting Hsu and Jianlong Fu and Min Sun},
journal= {arXiv preprint arXiv:1705.00930},
year = {2017}
}
备注
ICCV 2017