基于动态知识蒸馏与软对齐的双学习框架用于部分相关视频检索
计算机视觉与模式识别
2025-10-15 v1
摘要
几乎所有之前的文本到视频检索工作都理想化地假设视频被裁剪成仅包含文本相关内容的短时段。然而实际情况是,视频通常时长较长且背景内容复杂。因此,本文聚焦于更实际且具挑战性的部分相关视频检索 (PRVR) 任务,即依据给定查询检索部分相关的未裁剪视频。为解决该任务,我们提出一种新框架,从强大的大规模视觉语言预训练模型中蒸馏通用知识,并传递至轻量化、针对性的 PRVR 网络。具体而言,我们引入具动态知识蒸馈的双学习框架 (DL-DKD++),其中大型教师模型为紧凑的双支路学生网络提供监督。学生模型包含两个支路:一个继承支路吸收教师的可迁移知识,一个探索支路从 PRVR 数据集中学习任务特定信息以弥补领域差距。为进一步提升学习效果,我们采用动态软目标构建机制。通过将刚性硬目标监督替换为在训练期间演变的自适应软目标,我们的 метод使模型能更好地捕获视频与查询之间细粒度、部分相关性。实验结果表明,我们的所提方法在 TVR、ActivityNet 和 Charades-STA 数据集上实现了 PRVR 的最新性能。代码已公开于 https://github.com/HuiGuanLab/DL-DKD。
引用
@article{arxiv.2510.12283,
title = {Dual Learning with Dynamic Knowledge Distillation and Soft Alignment for Partially Relevant Video Retrieval},
author = {Jianfeng Dong and Lei Huang and Daizong Liu and Xianke Chen and Xun Yang and Changting Lin and Xun Wang and Meng Wang},
journal= {arXiv preprint arXiv:2510.12283},
year = {2025}
}