将人脸插入描述:基于注意力引导合并的图像描述
计算机视觉与模式识别
2024-05-07 v1 人工智能
计算与语言
图像与视频处理
摘要
图像描述模型被广泛用于描述近期和存档的图片,旨在提高其可访问性和检索效率。然而,这些方法在检索人名时往往效率低下且存在偏差。在这项工作中,我们引入了 AstroCaptions,一个用于图像描述任务的数据集。该数据集特别包含了数千张传统模型难以识别的公众人物图像。我们还提出了一种新颖的后处理方法,利用可解释人工智能工具和视觉-语言模型的定位能力,将识别出的人名插入到描述中。使用该方法获得的结果显示,描述质量有显著提升,并且有减少幻觉的潜力。高达 93.2% 的检测到的人物可以被插入到图像描述中,从而提高了每个描述模型的 BLEU、ROUGE、CIDEr 和 METEOR 分数。
引用
@article{arxiv.2405.02305,
title = {Inserting Faces inside Captions: Image Captioning with Attention Guided Merging},
author = {Yannis Tevissen and Khalil Guetari and Marine Tassel and Erwan Kerleroux and Frédéric Petitpont},
journal= {arXiv preprint arXiv:2405.02305},
year = {2024}
}