Concadia:面向目的驱动的基于图像的文本生成
计算与语言
2022-10-31 v3
摘要
当前的深度学习模型在基准图像到文本数据集上常取得优异结果,却无法生成实践中可用的文本。我们认为,要缩小这一差距,必须依据其不同的交际角色区分描述(description)与说明文字(caption)。描述聚焦于视觉特征,旨在替代图像(常为了提升可访问性),而说明文字与图像一同出现以补充额外信息。为倡导这一区分并助益实践,我们引入了公开可用的基于维基百科的数据集 Concadia,其包含 96,918 张图像及相应的英文描述、说明文字与周边上下文。利用来自 Concadia 的洞见、在其上训练的模型,以及一项针对人类与模型生成文本的事先注册人类受试者实验,我们刻画了描述与说明文字的共性与差异。此外,我们表明,对于生成描述与说明文字,用图像出现处的文本上下文表示来增强图像到文本模型是有益的。
引用
@article{arxiv.2104.08376,
title = {Concadia: Towards Image-Based Text Generation with a Purpose},
author = {Elisa Kreiss and Fei Fang and Noah D. Goodman and Christopher Potts},
journal= {arXiv preprint arXiv:2104.08376},
year = {2022}
}
备注
Proceedings of EMNLP 2022