基于蕴含奖励的强化视频描述
计算与语言
2017-08-09 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
序列到序列模型在视频描述这一时序任务上展现出可喜的改进,但它们在训练过程中优化的是词级交叉熵损失。首先,使用策略梯度和混合损失方法进行强化学习,我们直接优化句子级基于任务的度量指标(作为奖励),在多个数据集上的自动度量指标和人工评估中均取得了相对于基线的显著提升。接下来,我们提出了一种新颖的蕴含增强奖励(CIDEnt),它修正了基于短语匹配的度量指标(如 CIDEr),使其仅允许逻辑蕴含的部分匹配并避免矛盾,相较于 CIDEr 奖励模型取得了进一步的显著提升。总体而言,我们的 CIDEnt 奖励模型在 MSR-VTT 数据集上取得了新的 SOTA。
引用
@article{arxiv.1708.02300,
title = {Reinforced Video Captioning with Entailment Rewards},
author = {Ramakanth Pasunuru and Mohit Bansal},
journal= {arXiv preprint arXiv:1708.02300},
year = {2017}
}
备注
EMNLP 2017 (9 pages)