零依赖双阶段学习的情境检索增强
计算机视觉与模式识别
2025-12-02 v2
摘要
现有情境检索方法面临三个关键瓶颈:(1) 数据稀缺导致模型仅能建立浅层关键词-特征关联;(2) 相邻事件之间过渡区域的边界模糊;(3) 细粒度语义区分不足(例如难以区分“踢球”和“投球”)。本文提出一种零外部依赖的增强情境检索框架AMR,旨在克服因数据标注不足导致的局部最优问题,以及边界和语义辨识能力不足的限制。AMR基于两个关键洞察:(1) 在无需额外数据的前提下解决边界模糊和语义混淆问题(避免高成本的人工标注);(2) 保持由训练增强的边界和语义辨识能力,并在实际场景中获得良好泛化,显著提升性能。进一步,我们提出双阶段训练框架,包括冷启动阶段和蒸馏适应阶段。冷启动阶段利用增强数据进行课程学习,以建立基础的边界/语义意识。蒸馏阶段引入双查询集:原始查询集维持基于DETR的定位,使用来自冷启动模型的冻结基查询;主动查询集动态适应真实数据分布。跨阶段蒸馏损失强制原始查询与基查询之间的一致性,防止知识遗忘,同时实现实际场景的泛化。实验在多个基准数据集上表明,AMR在性能上优于先前的领先方法。
引用
@article{arxiv.2510.19622,
title = {Augmenting Moment Retrieval: Zero-Dependency Two-Stage Learning},
author = {Zhengxuan Wei and Jiajin Tang and Sibei Yang},
journal= {arXiv preprint arXiv:2510.19622},
year = {2025}
}
备注
This work is accepted by ICCV 2025