A-CAP:基于常识知识的预期描述生成
计算机视觉与模式识别
2023-04-14 v1
摘要
人类具备基于随时间获取的稀疏视觉线索推理未来的能力。为模拟该能力,我们引入一项称为预期描述生成(Anticipation Captioning)的新任务,其利用按时间稀疏排序的一组图像为未见过的预言图像生成描述。为应对此新任务,我们提出一种称为 A-CAP 的模型,该模型将常识知识融入预训练的视觉-语言模型中,使其能够对描述进行预期。通过在定制的视觉叙事数据集上进行定性与定量评估,A-CAP 优于其他图像描述方法,并为预期描述生成建立了强基线。我们也探讨了该任务固有的挑战。
引用
@article{arxiv.2304.06602,
title = {A-CAP: Anticipation Captioning with Commonsense Knowledge},
author = {Duc Minh Vo and Quoc-An Luong and Akihiro Sugimoto and Hideki Nakayama},
journal= {arXiv preprint arXiv:2304.06602},
year = {2023}
}
备注
Accepted to CVPR 2023