一种基于多参考的自可解释风格化图像描述框架
计算与语言
2021-11-19 v2
摘要
在本文中,我们提出通过多风格多模态机制(2M)构建风格化图像描述模型。我们证明利用 2M 可以构建一个有效的风格化描述器,并且该模型产生的多参考也可以通过识别错误样本上的错误输入特征来支持解释模型。我们展示了如何使用该 2M 机制构建风格化描述模型,并展示如何利用这些模型对模型中可能的错误提供解释。
引用
@article{arxiv.2110.10704,
title = {A Self-Explainable Stylish Image Captioning Framework via Multi-References},
author = {Chengxi Li and Brent Harrison},
journal= {arXiv preprint arXiv:2110.10704},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2103.11186 This paper is under consideration at Computer Vision and Image Understanding