面向物理音视频常识推理的鲁棒解缠系对抗学习
计算机视觉与模式识别
2025-02-19 v1
摘要
本文提出一种新的鲁棒解缠系对抗学习 (RDCL) 方法,用于物理音视频常识推理。该任务旨在基于视频和音频输入推断物体的物理常识,主要挑战在于如何在缺失模态的情况下模拟人类的推理能力。大多数现有方法未能充分利用多模态数据的不同特征,缺乏对因果推理能力也阻碍了隐式物理知识的推断进展。为此,我们提出的 RDCL 方法通过解缠系顺序编码器将视频分解为静态 (时不变) 和动态 (时变) 因子于潜在空间中,后者采用变分自编码器 (VAE) 以对比损失函数最大化互信息。进一步,我们引入对抗学习模块以增强模型的推理能力,建模不同物体之间在对抗干预下的物理知识关系。为缓解不完整模态数据问题,我们引入鲁棒多模态学习方法,通过分解共享特征和模型特定特征来恢复缺失数据。我们提出的方法是可即插即用的模块,可整合到包括视觉语言模型在内的任何基线方法中。实验表明,我们提出的方法提高了基线方法的推理准确率和鲁棒性,并实现了最新的性能。
引用
@article{arxiv.2502.12425,
title = {Robust Disentangled Counterfactual Learning for Physical Audiovisual Commonsense Reasoning},
author = {Mengshi Qi and Changsheng Lv and Huadong Ma},
journal= {arXiv preprint arXiv:2502.12425},
year = {2025}
}