通过半透最大似然估计学习描述性图像字幕生成
计算与语言
2023-10-31 v3
摘要
图像字幕生成旨在以自然语言描述视觉内容。正如“一图胜千言”,一幅图像可能有多种正确的描述。然而,以最大似然估计作为训练目标时,只要字幕模型的预测与标签不符就会受到惩罚。例如,当模型预测出一个比标签语义更丰富的词时,它会被惩罚并优化为偏好更简洁的表达,这被称为简洁性优化。相反,比标签更简洁的预测会导致丰富性优化。这种相互冲突的优化方向最终可能导致模型生成笼统的描述。在本工作中,我们提出半透最大似然估计(Semipermeable MaxImum Likelihood Estimation, SMILE),它允许丰富性优化而阻断简洁性优化,从而鼓励模型生成更长且包含更多细节的字幕。在两个主流图像字幕数据集 MSCOCO 和 Flickr30K 上的大量实验表明,SMILE 显著增强了生成字幕的描述性。我们进一步进行深入探究,以更好地理解 SMILE 的作用机制。
引用
@article{arxiv.2306.13460,
title = {Learning Descriptive Image Captioning via Semipermeable Maximum Likelihood Estimation},
author = {Zihao Yue and Anwen Hu and Liang Zhang and Qin Jin},
journal= {arXiv preprint arXiv:2306.13460},
year = {2023}
}
备注
Accepted to NeurIPS 2023