Transformer 时代的图像描述生成
计算机视觉与模式识别
2022-04-18 v1
摘要
图像描述生成(IC)通过将多种技术融入 CNN-RNN 编码器-解码器架构取得了令人惊叹的发展。然而,由于 CNN 与 RNN 不共享基础网络组件,这种异构流水线难以端到端训练,其中视觉编码器无法从描述监督中学习任何信息。这一缺陷促使研究者开发一种有助于端到端训练的同源架构,而 Transformer 正是完美之选:它已在视觉与语言领域证明其巨大潜力,因而可用作 IC 流水线中视觉编码器与语言解码器的基础组件。同时,自监督学习释放了 Transformer 架构的能力,预训练的大规模模型可泛化至包括 IC 在内的多种任务。这些大规模模型的成功似乎削弱了单一 IC 任务的重要性。然而,我们通过分析 IC 与若干流行自监督学习范式之间的联系,论证了 IC 在这个时代仍具有其特定意义。受篇幅限制,本短综述仅引用极为重要的论文,更多相关工作见 https://github.com/SjokerLily/awesome-image-captioning。
引用
@article{arxiv.2204.07374,
title = {Image Captioning In the Transformer Age},
author = {Yang Xu and Li Li and Haiyang Xu and Songfang Huang and Fei Huang and Jianfei Cai},
journal= {arXiv preprint arXiv:2204.07374},
year = {2022}
}
备注
8pages,2 figures