CapText:基于大语言模型从图像上下文与描述生成 caption
机器学习
2023-06-07 v2 计算与语言
摘要
尽管深度学习模型在图像到文本数据集上表现良好,但在实际中很难将其用于图像 caption 生成。这是因为传统上 caption 往往依赖于上下文并提供关于图像的互补信息,而模型倾向于产生描述图像视觉特征的文本。先前关于 caption 生成的研究探索了在提供图像及其相应描述或上下文时生成 caption 的模型。我们提出并评估了一种新方法,该方法利用现有大语言模型仅从文本描述和上下文生成 caption,而从未直接处理图像。我们证明,在经过微调后,我们的方法在该任务上的 CIDEr 指标上优于当前最先进的图像-文本对齐模型(如 OSCAR-VinVL)。
引用
@article{arxiv.2306.00301,
title = {CapText: Large Language Model-based Caption Generation From Image Context and Description},
author = {Shinjini Ghosh and Sagnik Anupam},
journal= {arXiv preprint arXiv:2306.00301},
year = {2023}
}
备注
Update 6/6/23: Fixed typographic error in abstract