用于图像字幕的Actor-Critic序列训练
计算机视觉与模式识别
2017-11-29 v2
摘要
生成图像的自然语言描述对于可能需要与人类用户交流其所见内容的机器人或其他视觉智能驱动的AI智能体而言是一项重要能力。此类图像字幕方法通常通过最大化给定图像下真实标注字幕的似然来进行训练。尽管简单且易于实现,该方法并不能直接最大化我们所关注的语言质量度量(如CIDEr)。本文研究基于Actor-Critic强化学习的图像字幕方法训练,以直接优化感兴趣的非可微质量度量。通过在这种新颖的基于强化学习的字幕模型中制定逐词优势与价值计算策略,我们表明可以在广泛使用的MSCOCO基准上取得最先进的性能。
引用
@article{arxiv.1706.09601,
title = {Actor-Critic Sequence Training for Image Captioning},
author = {Li Zhang and Flood Sung and Feng Liu and Tao Xiang and Shaogang Gong and Yongxin Yang and Timothy M. Hospedales},
journal= {arXiv preprint arXiv:1706.09601},
year = {2017}
}