用于图像描述的双流协同 Transformer
计算机视觉与模式识别
2026-01-21 v1
摘要
当前基于区域特征的图像描述方法发展迅速并取得了显著的性能。然而,由于缺乏上下文信息以及过度依赖已生成的部分描述来预测剩余单词,它们仍然容易生成不相关的描述。在本文中,我们提出了一种双流协同 Transformer(DSCT),通过引入分割特征来解决这一问题。所提出的 DSCT 首先整合然后融合区域特征和分割特征,以指导描述句子的生成。它包含多个特定模式互注意力编码器(PSMAE)和动态提名解码器(DND)。PSMAE 通过相互查询,有效地突出并整合两种表征的私有信息。DND 动态搜索与输入文本表征最相关的学习块,并利用整合后的区域特征与分割特征之间的同质特征,生成更准确、更具描述性的描述句子。据我们所知,这是首个探索如何以动态方式融合不同特定模式特征,从而绕过其语义不一致和空间错位问题以进行图像描述的研究。在流行基准数据集上的实验结果表明,我们的 DSCT 优于文献中最先进的图像描述模型。
引用
@article{arxiv.2601.12926,
title = {Dual-Stream Collaborative Transformer for Image Captioning},
author = {Jun Wan and Jun Liu and Zhihui lai and Jie Zhou},
journal= {arXiv preprint arXiv:2601.12926},
year = {2026}
}