中文

基于知识细化的双上下文感知网络用于部分相关视频检索

计算机视觉与模式识别 2026-03-26 v1 人工智能

摘要

从未经剪裁的视频中检索部分相关片段仍然困难,因为面临两个持续存在的挑战:文本和视频片段之间信息密度的不匹配,以及 limited attention mechanisms 忽略语义焦点和事件关联。我们提出了 KDC-Net,即 Knowledge-Refined Dual Context-Aware Network,通过文本和视觉两个角度来解决这些问题。在文本侧,层次语义聚合模块捕捉并自适应融合多尺度短语线索,以丰富查询语义。在视频侧,动态时序注意机制采用相对位置编码和自适应时序窗口,以突出具有局部时序一致性的关键事件。此外,一种增强了时序连续性细化的动态 CLIP-based distillation 策略,确保分段感知且目标对齐的知识传递。PRVR benchmark 上的实验表明,KDC-Net 在 state-of-the-art 方法中始终表现出色,尤其在 moment-to-video 比例较低时效果更为突出。

关键词

引用

@article{arxiv.2603.23902,
  title  = {Knowledge-Refined Dual Context-Aware Network for Partially Relevant Video Retrieval},
  author = {Junkai Yang and Qirui Wang and Yaoqing Jin and Shuai Ma and Minghan Xu and Shanmin Pang},
  journal= {arXiv preprint arXiv:2603.23902},
  year   = {2026}
}

备注

Accepted in ICME 2026