B-SCST:用于图像字幕的贝叶斯自临界序列训练
机器学习
2020-06-30 v2 机器学习
摘要
贝叶斯深度神经网络(DNN)能够提供一个有数学依据的框架,以量化图像字幕模型预测中的不确定性。我们提出了一种基于策略梯度的强化学习训练技术的贝叶斯变体,用于图像字幕模型,以直接优化不可微的图像字幕质量指标,如 CIDEr-D。我们通过引入贝叶斯推断扩展了著名的用于图像字幕模型的自临界序列训练(SCST)方法,并将其称为 B-SCST。B-SCST 中策略梯度的“基线”是通过对使用贝叶斯 DNN 模型获得的分布中抽取的字幕的预测质量指标(CIDEr-D)取平均生成的。我们使用蒙特卡洛(MC)dropout 近似变分推断来推断该预测分布。我们表明,与 SCST 方法相比,B-SCST 在 Flickr30k、MS COCO 和 VizWiz 图像字幕数据集上提升了 CIDEr-D 分数。我们还提供了对预测字幕的不确定性量化的研究,并证明其与 CIDEr-D 分数具有良好的相关性。据我们所知,这是首个此类分析,它可以提升图像字幕模型输出的可解释性,这对于实际应用至关重要。
引用
@article{arxiv.2004.02435,
title = {B-SCST: Bayesian Self-Critical Sequence Training for Image Captioning},
author = {Shashank Bujimalla and Mahesh Subedar and Omesh Tickoo},
journal= {arXiv preprint arXiv:2004.02435},
year = {2020}
}