面向身份感知电影描述的统一模型MICap
计算机视觉与模式识别
2024-05-21 v1
摘要
角色是任何情节的重要方面,识别并包含其在描述中是必要的,以便理解情节。虽然以往工作在很大程度上忽略了身份标识,生成的描述中使用了某人(匿名姓名),但近期工作将ID感知式描述 formulated as fill-in-the-blanks (FITB) 任务,即给定一个带有空白的描述,目标是预测人物ID标签。然而,要生成包含ID的描述,需要两个阶段的方法:首先预测带某人的描述,然后填入身份。在本工作中,我们提出一种新的单阶段方法,可无缝切换ID感知式描述生成或FITB当给定带空白的描述时。我们的模型,电影身份描述生成器 (MICap),使用共享的自回归解码器,受益于FITB和完整描述生成目标的训练,同时编码器可受益或不受益于带有空白的描述作为输入。另一方面,ID感知式描述的另一个挑战是缺乏一种度量标准来捕捉人物ID之间细微差异。为此,我们引入iSPICE,这是一个关注通过中间场景图创建的身份元组的描述评估指标。我们在Large-Scale Movie Description Challenge (LSMDC) 上评估了MICap,显示在FITB准确率上提升了4.2%,在经典描述指标上提升了1-2%。
引用
@article{arxiv.2405.11483,
title = {MICap: A Unified Model for Identity-aware Movie Descriptions},
author = {Haran Raajesh and Naveen Reddy Desanur and Zeeshan Khan and Makarand Tapaswi},
journal= {arXiv preprint arXiv:2405.11483},
year = {2024}
}
备注
CVPR 2024, Project Page: https://katha-ai.github.io/projects/micap/