用于长期动作识别的跨模态双因果学习
计算机视觉与模式识别
2025-08-04 v2
摘要
长期动作识别(LTAR)因其扩展的时间跨度和复杂的原子动作关联以及视觉干扰因素而具有挑战性。虽然视觉语言模型(VLM)显示出前景,但它们往往依赖于统计相关性而非因果机制。此外,现有的因果方法仅针对模态特定的偏见进行建模,缺乏跨模态因果建模,限制了其在VLM-based LTAR中的实用性。本文提出了跨模态双因果学习(CMDCL),该方法引入结构化因果模型以揭示视频与标签文本之间的因果关系。CMDCL通过文本因果干预来解决文本嵌入中的跨模态偏见,通过受无偏文本引导的视觉因果干预来消除视觉模态中固有的混淆因素。这些双因果干预使我们能够构建稳健的动作表征,以解决LTAR的挑战。在包括Charades、Breakfast和COIN在内的三个基准测试上进行的实验结果表明,所提出的模型有效且可行。我们的代码可在https://github.com/xushaowu/CMDCL获取。
引用
@article{arxiv.2507.06603,
title = {Cross-Modal Dual-Causal Learning for Long-Term Action Recognition},
author = {Xu Shaowu and Jia Xibin and Gao Junyu and Sun Qianmei and Chang Jing and Fan Chao},
journal= {arXiv preprint arXiv:2507.06603},
year = {2025}
}