说同一种语言:通过对抗训练使机器与人类描述相匹配
计算机视觉与模式识别
2017-11-07 v2 人工智能
计算与语言
摘要
尽管近年来图像描述取得了巨大进展,但机器与人类的描述仍有显著差异。深入观察可以发现,这是由于生成的词分布、词汇量大小存在缺陷,以及生成器对频繁描述存在强烈偏差。此外,由于描述任务固有的模糊性,人类理所当然地会生成多个多样化的描述,而当今的系统并未考虑到这一点。为了应对这些挑战,我们将描述生成器的训练目标从重现真实描述转变为生成一组与人类生成描述不可区分的描述。我们不手工设计这样的学习目标,而是采用对抗训练结合近似 Gumbel 采样器,将生成的分布隐式地与人类分布相匹配。虽然我们的方法在描述正确性方面取得了与 SOTA 相当的性能,但我们生成了一组多样化的描述,这些描述的偏差显著减小,并在多个方面更好地匹配了词统计。
引用
@article{arxiv.1703.10476,
title = {Speaking the Same Language: Matching Machine to Human Captions by Adversarial Training},
author = {Rakshith Shetty and Marcus Rohrbach and Lisa Anne Hendricks and Mario Fritz and Bernt Schiele},
journal= {arXiv preprint arXiv:1703.10476},
year = {2017}
}
备注
16 pages, Published in ICCV 2017