iReason:利用视频与自然语言进行可解释的多模态常识推理
计算机视觉与模式识别
2021-07-23 v1 人工智能
计算与语言
机器学习
多媒体
图像与视频处理
摘要
因果知识对构建鲁棒 AI 系统至关重要。深度学习模型在需要因果推理的任务上往往表现不佳,而因果推理通常利用某种形式的常识知识推导得出,这些知识在输入中并非立即可见,而是由人类隐式推断。先前工作已揭示模型在缺乏因果性时陷入的虚假观测偏差。虽然语言表示模型在所学嵌入中保留了上下文知识,但它们在训练时并未考虑因果关系。通过将因果关系与执行视觉认知任务(如场景理解、视频字幕生成、视频问答等)的现有模型输入特征相融合,可因因果关系带来的洞察而获得更好性能。近来,已有若干模型提出,处理了从视觉或文本模态中挖掘因果数据的任务。然而,通过并列视觉与语言模态来挖掘因果关系的研究尚不广泛。尽管图像为我们提供了丰富且易于处理的资源以从中挖掘因果知识,视频则更密集且由自然时间有序事件组成。此外,文本信息提供了视频中可能为隐式的细节。我们提出 iReason,一个利用视频与自然语言字幕推断视觉-语义常识知识的框架。此外,iReason 的架构集成了因果合理化模块,以辅助可解释性、错误分析与偏差检测过程。我们使用与语言表示学习模型(BERT、GPT-2)以及当前最先进多模态因果模型的两方面比较分析,展示了 iReason 的有效性。
引用
@article{arxiv.2107.10300,
title = {iReason: Multimodal Commonsense Reasoning using Videos and Natural Language with Interpretability},
author = {Aman Chadha and Vinija Jain},
journal= {arXiv preprint arXiv:2107.10300},
year = {2021}
}
备注
12 pages, 1 figure, 7 tables