CIC:面向文化感知图像描述的框架
计算机视觉与模式识别
2025-02-25 v5 人工智能
计算与语言
摘要
图像描述通过视觉语言预训练模型(如 BLIP)生成从图像中生成描述性句子,这些模型已取得显著进步。然而,当前方法缺乏对图像中所呈现文化元素(如来自亚洲文化群体的人们所穿着的传统服饰)进行详细描述的能力。本文提出了一种新框架,文化感知图像描述(CIC),该框架从代表文化的图像中提取文化视觉元素,并生成具有文化描述性的标题。灵感来源于通过适当提示将视觉模态与大语言模型(LLM)相结合的方法,我们的框架(1)基于图像生成文化类别的问题,(2)使用生成的问题从视觉问答(VQA)中提取文化视觉元素,(3)使用 LLM 和提示生成具有文化感知的标题。我们对45名来自4个不同文化群体的受试者进行的人类评估,结果表明,所提出的框架在生成具有文化描述性的标题方面优于基于视觉语言预训练模型的图像描述基线。资源可在 https://shane3606.github.io/cic 查找。
引用
@article{arxiv.2402.05374,
title = {CIC: A Framework for Culturally-Aware Image Captioning},
author = {Youngsik Yun and Jihie Kim},
journal= {arXiv preprint arXiv:2402.05374},
year = {2025}
}
备注
Accepted by IJCAI 2024