KAFA:以知识增强特征适配重新审视视觉语言模型的图像广告理解
计算机视觉与模式识别
2023-05-31 v1 计算与语言
摘要
图像广告理解是一项具有广泛现实应用的关键任务。尽管涉及多样非典型场景、真实世界实体及场景文本推理而极具挑战,如何解读图像广告仍相对未被充分探索,尤其在具备惊人泛化与适配能力的基础视觉语言模型(VLM)时代。本文通过预训练VLM的视角,首次对图像广告理解进行实证研究。我们基准测试并揭示了将这些VLM适配到图像广告理解中的实际挑战。我们提出一种简单的特征适配策略,有效融合图像广告的多模态信息,并进一步以真实世界实体知识赋能。我们希望本研究能引起更多对图像广告理解的关注,其与广告行业广泛相关。
引用
@article{arxiv.2305.18373,
title = {KAFA: Rethinking Image Ad Understanding with Knowledge-Augmented Feature Adaptation of Vision-Language Models},
author = {Zhiwei Jia and Pradyumna Narayana and Arjun R. Akula and Garima Pruthi and Hao Su and Sugato Basu and Varun Jampani},
journal= {arXiv preprint arXiv:2305.18373},
year = {2023}
}
备注
ACL 2023