FaceGemma:利用面部属性增强人像图像描述生成
计算机视觉与模式识别
2024-07-16 v2
摘要
自动图像描述生成对于提升视觉内容的可访问性与理解至关重要。本研究引入FaceGemma,一种能准确描述情绪、表情与特征等面部属性的模型。利用FaceAttdb数据,我们以Llama 3 - 70B模型为2000张人脸生成描述,并用这些描述微调PaliGemma模型。基于FaceAttDB中提供的属性与描述,我们构建了一个新的描述数据集,其中每条描述都完美刻画了人工标注的属性,包括吸引力、丰满嘴唇、大鼻子、金发、棕发、浓眉、眼镜、男性、微笑和年轻等关键特征。这一细致方法确保生成描述与图像中细微视觉细节紧密对齐。我们的FaceGemma模型利用一种创新的图像描述方法,通过标注属性、人工标注描述与提示工程来生成高质量面部描述。我们的方法显著提升了描述质量,取得平均BLEU-1分数0.364与METEOR分数0.355。这些指标证明了将面部属性纳入图像描述的有效性,为肖像图像提供了更准确且更具描述性的说明。
引用
@article{arxiv.2309.13601,
title = {FaceGemma: Enhancing Image Captioning with Facial Attributes for Portrait Images},
author = {Naimul Haque and Iffat Labiba and Sadia Akter},
journal= {arXiv preprint arXiv:2309.13601},
year = {2024}
}