中文

用于零样本自然语言视频定位的常识推理

计算机视觉与模式识别 2024-02-02 v2 人工智能 计算与语言 机器学习

摘要

零样本自然语言视频定位(NLVL)方法通过动态生成视频片段和伪查询注释,仅使用原始视频数据训练NLVL模型,已展现出有希望的结果。然而,现有的伪查询通常缺乏在源视频中的基础,导致内容结构松散且不连贯。在本文中,我们研究了常识推理在零样本NLVL中的有效性。具体来说,我们提出了CORONET,一个零样本NLVL框架,它利用常识通过常识增强模块弥合视频和生成的伪查询之间的差距。CORONET使用图卷积网络(GCN)编码从知识图谱中提取的常识信息,以视频为条件,并使用交叉注意力机制在定位之前增强编码的视频和伪查询表示。通过在两个基准数据集上的实证评估,我们证明CORONET超越了零样本和弱监督基线,在各种召回阈值上实现了高达32.13%的提升,在mIoU上实现了高达6.33%的提升。这些结果强调了利用常识推理进行零样本NLVL的重要性。

关键词

引用

@article{arxiv.2312.17429,
  title  = {Commonsense for Zero-Shot Natural Language Video Localization},
  author = {Meghana Holla and Ismini Lourentzou},
  journal= {arXiv preprint arXiv:2312.17429},
  year   = {2024}
}

备注

Accepted to AAAI 2024