超越通用:利用视觉-语言预训练模型以真实世界知识增强图像描述生成
计算机视觉与模式识别
2023-08-03 v1 计算与语言
多媒体
摘要
当前的描述生成方法倾向于生成正确但“通用”的描述,缺乏真实世界知识,例如命名实体与上下文信息。考虑到视觉-语言预训练(VLP)模型从大规模网络采集数据中掌握了海量此类知识,利用 VLP 模型的泛化能力将知识融入图像描述是具有前景的。然而,使用 VLP 模型面临挑战:零样本推理遭受知识幻觉,导致低质量描述;而下游任务微调中的通用偏置阻碍了 VLP 模型表达知识。为解决这些问题,我们提出一种简洁而有效的方法,称为知识引导回放(K-Replay),其能够在微调过程中保留预训练知识。我们的方法由两部分组成:(1)在自动收集的回放样本上进行知识预测任务,持续唤醒 VLP 模型关于知识的记忆,从而防止模型坍缩为通用模式;(2)知识蒸馏约束以提高生成描述的忠实度,进而缓解知识幻觉。为评估知识增强的描述,我们构建了一个新的描述基准 KnowCap,包含地标、著名品牌、特色食物和电影角色的知识。实验结果表明,我们的方法有效地将知识融入描述,在 CIDEr 分数上以 20.9 分(78.7->99.6)优于强 VLP 基线,在知识识别准确率上以 20.5 个百分点(34.0%->54.5%)优于强 VLP 基线。我们的代码与数据可在 https://github.com/njucckevin/KnowCap 获取。
引用
@article{arxiv.2308.01126,
title = {Beyond Generic: Enhancing Image Captioning with Real-World Knowledge using Vision-Language Pre-Training Model},
author = {Kanzhi Cheng and Wenpo Song and Zheng Ma and Wenhao Zhu and Zixuan Zhu and Jianbing Zhang},
journal= {arXiv preprint arXiv:2308.01126},
year = {2023}
}
备注
Accepted at ACM Multimedia (ACMMM) 2023