中文

DMC$^3$:面向自我中心视频问答的双模态反事实对比构建

计算机视觉与模式识别 2025-12-02 v2 多媒体

摘要

自我中心视频问答(Egocentric VideoQA)在自我中心视频理解中扮演着重要角色,它指的是基于第一人称视频来回答问题。尽管现有方法通过预训练和微调的范式取得了进展,但它们忽略了第一人称视角带来的独特挑战,例如理解多个事件和识别手-物交互。为了应对这些挑战,我们提出了一个双模态反事实对比构建(DMC3^3)框架,该框架包含一个自我中心视频问答基线、一个反事实样本构建模块和一个涉及反事实样本的对比优化模块。具体来说,我们首先开发了一个反事实样本构建模块,分别通过事件描述释义和核心交互挖掘为文本和视觉模态生成正样本和负样本。然后,我们将这些样本与原始样本一起输入基线模型。最后,在涉及反事实样本的对比优化模块中,我们应用对比损失来最小化原始样本特征与正样本特征之间的距离,同时最大化与负样本特征之间的距离。实验表明,我们的方法在EgoTaskQA数据集的\textit{normal}和\textit{indirect}划分上分别达到了52.51%和46.04%的准确率,在QAEGO4D数据集上达到了13.2%的准确率,均达到了最先进的性能。

关键词

引用

@article{arxiv.2510.20285,
  title  = {DMC$^3$: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering},
  author = {Jiayi Zou and Chaofan Chen and Bing-Kun Bao and Changsheng Xu},
  journal= {arXiv preprint arXiv:2510.20285},
  year   = {2025}
}