中文

面向图像描述的高效未来上下文建模

计算机视觉与模式识别 2022-10-19 v2

摘要

现有的图像描述方法通常从左至右逐词生成句子,受限于以给定图像与已生成历史词为条件的局部上下文。已有许多研究致力于在解码过程中利用全局信息,例如迭代精炼。然而,如何有效且高效地融入未来上下文仍待探索。针对此问题,受非自回归图像描述(NAIC)可通过改进掩码操作利用双向关系的启发,我们旨在将这一进展移植到常规自回归图像描述(AIC)模型中,同时保持推理效率而无额外时间开销。具体而言,首先联合训练 AIC 与 NAIC 模型并共享视觉编码器,迫使视觉编码器包含充分且有效的未来上下文;随后鼓励 AIC 模型在其不置信词上从 NAIC 模型捕获跨层交互的因果动态,遵循师生范式并以分布校准训练目标进行优化。经验证据表明,我们所提方法在 MS COCO 基准上明显超越最先进的基线,无论是自动指标还是人工评估。源代码见:https://github.com/feizc/Future-Caption。

关键词

引用

@article{arxiv.2207.10897,
  title  = {Efficient Modeling of Future Context for Image Captioning},
  author = {Zhengcong Fei and Junshi Huang and Xiaoming Wei and Xiaolin Wei},
  journal= {arXiv preprint arXiv:2207.10897},
  year   = {2022}
}

备注

ACM Multimedia 2022