TV-TREES:面向神经符号视频推理的多模态蕴含树
计算与语言
2024-10-11 v4 人工智能
计算机视觉与模式识别
摘要
模型理解电视片段等复杂多模态内容具有挑战性,部分原因在于视频-语言模型通常依赖单模态推理且缺乏可解释性。为解决这些问题,我们提出了TV-TREES,这是首个多模态蕴含树生成器。TV-TREES作为一种视频理解方法,通过搜索简单文本-视频证据与证明问答对的高级结论之间的蕴含关系树,促进了可解释的联合模态推理。我们还引入了多模态蕴含树生成任务来评估推理质量。我们的方法在具有挑战性的TVQA基准测试中,在全片段上展现了可解释的、最先进的零样本性能,表明多模态蕴含树生成可以成为黑盒系统的最佳替代方案。
引用
@article{arxiv.2402.19467,
title = {TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning},
author = {Kate Sanders and Nathaniel Weir and Benjamin Van Durme},
journal= {arXiv preprint arXiv:2402.19467},
year = {2024}
}
备注
9 pages, EMNLP 2024