超越不确定性:面向鲁棒视频时序 grounding 的证据深度学习
计算机视觉与模式识别
2024-08-30 v1 人工智能
摘要
现有的视频时序 grounding(VTG)模型在准确性方面表现突出,但常常忽视开放词汇查询和未剪辑视频所带来的现实挑战。这导致对噪声、损坏和分布外数据进行不可靠预测。基于用户输入动态估计不确定性可以解决此问题。为此,我们引入SRAM模块,该模块涉及两个阶段的跨模态对齐任务。更重要的是,它集成了深度证据回归(DER),以在训练期间显式且彻底地量化不确定性,从而允许模型在其处理能力范围之外说出“我不知道”。然而,直接应用传统DER理论及其正则化器会暴露结构性缺陷,导致对VTG任务产生意外约束。为此,我们开发了一种简单而有效的几何正则化器,从根本上增强了不确定性学习框架。据我们了解,这是首次成功将DER应用于VTG。我们的大量定量和定性结果确认了我们模块和不确定性学习范式在VTG任务中的有效性、鲁棒性和可解释性。代码将公开提供。
引用
@article{arxiv.2408.16272,
title = {Beyond Uncertainty: Evidential Deep Learning for Robust Video Temporal Grounding},
author = {Kaijing Ma and Haojian Huang and Jin Chen and Haodong Chen and Pengliang Ji and Xianghao Zang and Han Fang and Chao Ban and Hao Sun and Mulin Chen and Xuelong Li},
journal= {arXiv preprint arXiv:2408.16272},
year = {2024}
}
备注
Ongoing work: 28pages, 19 figures, 7 tables. Code is available at: https://kaijing.space/SRAM/