ANNA:基于过滤新闻标题的抽象式文本到图像合成
计算机视觉与模式识别
2024-08-06 v2 计算与语言
摘要
近年来文本到图像合成的进展更多聚焦于利用带描述性提示的数据集提升生成样本的质量。然而,新闻数据等领域中存在的真实图像-标题对并不使用简单且直接描述性的标题。由于标题同时包含图像内容与底层上下文线索的信息,其本质变得抽象。本文中,我们推出 ANNA,一个从在线新闻文章中提取、涵盖多种不同语境的抽象式新闻标题数据集(Abstractive News captioNs dAtaset)。我们通过在 ANNA 上以标准训练与迁移学习两种设定对当前文本到图像合成模型进行基准测试,探究其利用抽象标题生成新闻领域特定图像的能力。生成图像依据上下文相关性、视觉质量以及与真值图像-标题对的感知相似性进行评判。实验表明,迁移学习等技术在理解抽象标题上仅取得有限成功,仍无法稳定学习内容与上下文特征间的关系。数据集可在 https://github.com/aashish2000/ANNA 获取。
引用
@article{arxiv.2301.02160,
title = {ANNA: Abstractive Text-to-Image Synthesis with Filtered News Captions},
author = {Aashish Anantha Ramakrishnan and Sharon X. Huang and Dongwon Lee},
journal= {arXiv preprint arXiv:2301.02160},
year = {2024}
}
备注
To appear in the ACL 3rd Workshop on Advances in Language and Vision Research (ALVR), Bangkok, Thailand, August 2024, https://alvr-workshop.github.io