中文

用于物理视听常识推理的解耦反事实学习

计算机视觉与模式识别 2023-11-03 v2

摘要

本文提出一种用于物理视听常识推理的解耦反事实学习(DCL)方法。该任务旨在基于视频和音频输入推断物体的物理常识,其主要挑战在于如何模仿人类的推理能力。当前大多数方法未能充分利用多模态数据中不同特性的优势,且模型缺乏因果推理能力,阻碍了隐式物理知识推断的进展。为解决这些问题,我们提出的 DCL 方法通过解耦时序编码器将视频在潜空间中解耦为静态(时不变)和动态(时变)因子,该编码器采用变分自编码器(VAE)以对比损失函数最大化互信息。此外,我们引入反事实学习模块,通过在反事实干预下建模不同物体间的物理知识关系来增强模型的推理能力。我们提出的方法是一个即插即用的模块,可集成到任何基线模型中。在实验中,我们表明所提方法改进了基线方法并达到了最先进的性能。我们的源代码可在 https://github.com/Andy20178/DCL 获取。

关键词

引用

@article{arxiv.2310.19559,
  title  = {Disentangled Counterfactual Learning for Physical Audiovisual Commonsense Reasoning},
  author = {Changsheng Lv and Shuai Zhang and Yapeng Tian and Mengshi Qi and Huadong Ma},
  journal= {arXiv preprint arXiv:2310.19559},
  year   = {2023}
}

备注

To be published in 37th Conference on Neural Information Processing Systems