中文

基于交叉修正注意力的精修模型用于图像描述生成

计算机视觉与模式识别 2024-10-28 v1 人工智能 多媒体

摘要

传统的图像描述生成编码器-解码器框架通常采用单次解码过程,按时间顺序逐词预测目标描述句。尽管该框架取得了巨大成功,仍存在两个严重缺陷。首先,它无法纠正已预测词中的错误,这可能误导后续预测并导致错误累积问题。其次,此类框架只能利用已生成的词而无法利用可能的未来词,因而缺乏对语言信息的全局规划能力。为克服这些局限,我们探索了一种通用的两次解码框架:其中基于单次解码的模型作为起草模型(Drafting Model)先根据输入图像生成草稿描述,随后精修模型(Deliberation Model)执行润色过程将草稿描述优化为更好的图像描述。此外,受不同模态间互补性的启发,我们提出一种新颖的交叉修正注意力(Cross Modification Attention, CMA)模块,以增强图像特征的语义表达并过滤草稿描述中的错误信息。我们将CMA与精修模型的解码器集成,称之为基于交叉修正注意力的精修模型(CMA-DM)。我们通过一个权衡系数联合优化所有可训练组件从头训练所提框架。在MS COCO数据集上的实验表明,我们的方法相较单次解码基线获得显著提升,并与其他最先进的两次解码方法取得有竞争力的性能。

关键词

引用

@article{arxiv.2109.08411,
  title  = {Cross Modification Attention Based Deliberation Model for Image Captioning},
  author = {Zheng Lian and Yanan Zhang and Haichang Li and Rui Wang and Xiaohui Hu},
  journal= {arXiv preprint arXiv:2109.08411},
  year   = {2024}
}

备注

This work has been submitted to the IEEE TMM for possible publication