中文

iReason:利用视频与自然语言进行可解释的多模态常识推理

计算机视觉与模式识别 2021-07-23 v1 人工智能 计算与语言 机器学习 多媒体 图像与视频处理

摘要

因果知识对构建鲁棒 AI 系统至关重要。深度学习模型在需要因果推理的任务上往往表现不佳,而因果推理通常利用某种形式的常识知识推导得出,这些知识在输入中并非立即可见,而是由人类隐式推断。先前工作已揭示模型在缺乏因果性时陷入的虚假观测偏差。虽然语言表示模型在所学嵌入中保留了上下文知识,但它们在训练时并未考虑因果关系。通过将因果关系与执行视觉认知任务(如场景理解、视频字幕生成、视频问答等)的现有模型输入特征相融合,可因因果关系带来的洞察而获得更好性能。近来,已有若干模型提出,处理了从视觉或文本模态中挖掘因果数据的任务。然而,通过并列视觉与语言模态来挖掘因果关系的研究尚不广泛。尽管图像为我们提供了丰富且易于处理的资源以从中挖掘因果知识,视频则更密集且由自然时间有序事件组成。此外,文本信息提供了视频中可能为隐式的细节。我们提出 iReason,一个利用视频与自然语言字幕推断视觉-语义常识知识的框架。此外,iReason 的架构集成了因果合理化模块,以辅助可解释性、错误分析与偏差检测过程。我们使用与语言表示学习模型(BERT、GPT-2)以及当前最先进多模态因果模型的两方面比较分析,展示了 iReason 的有效性。

关键词

引用

@article{arxiv.2107.10300,
  title  = {iReason: Multimodal Commonsense Reasoning using Videos and Natural Language with Interpretability},
  author = {Aman Chadha and Vinija Jain},
  journal= {arXiv preprint arXiv:2107.10300},
  year   = {2021}
}

备注

12 pages, 1 figure, 7 tables