中文

基于自适应证据学习的时序语义鲁棒性情节检索

计算机视觉与模式识别 2025-12-02 v1

摘要

在情节检索领域,基于自然语言查询准确识别视频中的时间段仍具有挑战性。传统方法常采用预训练模型,难以处理细粒度信息和确定性推理,导致难以与复杂或模糊情节对齐。为克服这些限制,我们探索使用深度证据回归 (DER) 构建一个 vanilla 证据基线。然而,该方法面临两个主要问题:无法有效处理模态不平衡,以及 DER 启发式不确定性正则化器的结构差异,这些问题会严重影响不确定性估计。我们的观察表明,现有方法缺乏应对复杂视频情景的适应性。为此,我们提出一种用于情节检索的去偏证据学习 (DEMR),该方法引入 Reflective Flipped Fusion (RFF) 块进行跨模态对齐,并通过查询重建任务增强文本敏感性,从而减少不确定性估计中的偏差。此外,我们引入几何正则化器以细化不确定性预测,实现对困难情节的自适应对齐并提高检索准确率。广泛的在标准数据集和去偏数据集 ActivityNet-CD 和 Charades-CD 上的测试表明,我们的方法在有效性、鲁棒性和可解释性方面均实现了显著提升,为情节检索中的时序语义鲁棒性提供了有前景的解决方案。代码已公开于 https://github.com/KaijingOfficial/DEMR。

关键词

引用

@article{arxiv.2512.00953,
  title  = {Adaptive Evidential Learning for Temporal-Semantic Robustness in Moment Retrieval},
  author = {Haojian Huang and Kaijing Ma and Jin Chen and Haodong Chen and Zhou Wu and Xianghao Zang and Han Fang and Chao Ban and Hao Sun and Mulin Chen and Zhongjiang He},
  journal= {arXiv preprint arXiv:2512.00953},
  year   = {2025}
}

备注

Accepted by AAAI 2026, 10 pages, 9 figures, 5 tables