中文

边界与填充:一种快速灵活的图像描述生成框架

计算机视觉与模式识别 2023-10-17 v1 计算与语言

摘要

大多数遵循自回归方式的图像描述模型存在显著的推理延迟。若干模型采用非自回归方式以加速过程。然而,原始非自回归方式因同时生成所有词而未能捕捉描述中词间关系,导致性能不佳。半自回归方式采用部分并行方法以保持性能,但牺牲了推理速度。本文引入一种基于边界与填充技术的快速灵活图像描述框架 BoFiCap。BoFiCap 模型利用图像描述任务的内在特性,预定义图像区域及其关系的边界框。随后,BoFiCap 模型使用两种生成方式在每个框中填充相应词汇。借助框提示,我们的填充过程使每个词能更好地感知其他词。此外,我们的模型提供灵活的图像描述生成:1)基于速度或性能需求采用不同生成方式;2)根据用户指定框产生不同句子。在 MS-COCO 基准数据集上的实验评估表明,我们的框架在非自回归方式下以任务特定指标 CIDEr(125.6)达到最优(SOTA),同时比自回归基线模型加速 9.22 倍;在半自回归方式下,我们的方法在 CIDEr 上达到 128.4,同时加速 3.69 倍。我们的代码与数据见 https://github.com/ChangxinWang/BoFiCap。

关键词

引用

@article{arxiv.2310.09876,
  title  = {Bounding and Filling: A Fast and Flexible Framework for Image Captioning},
  author = {Zheng Ma and Changxin Wang and Bo Huang and Zixuan Zhu and Jianbing Zhang},
  journal= {arXiv preprint arXiv:2310.09876},
  year   = {2023}
}

备注

NLPCC2023 Best Paper