中文

TV-TREES:面向神经符号视频推理的多模态蕴含树

计算与语言 2024-10-11 v4 人工智能 计算机视觉与模式识别

摘要

模型理解电视片段等复杂多模态内容具有挑战性,部分原因在于视频-语言模型通常依赖单模态推理且缺乏可解释性。为解决这些问题,我们提出了TV-TREES,这是首个多模态蕴含树生成器。TV-TREES作为一种视频理解方法,通过搜索简单文本-视频证据与证明问答对的高级结论之间的蕴含关系树,促进了可解释的联合模态推理。我们还引入了多模态蕴含树生成任务来评估推理质量。我们的方法在具有挑战性的TVQA基准测试中,在全片段上展现了可解释的、最先进的零样本性能,表明多模态蕴含树生成可以成为黑盒系统的最佳替代方案。

关键词

引用

@article{arxiv.2402.19467,
  title  = {TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning},
  author = {Kate Sanders and Nathaniel Weir and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2402.19467},
  year   = {2024}
}

备注

9 pages, EMNLP 2024