中文

不确定性最小化下的交互式文本到视频检索

计算机视觉与模式识别 2025-07-25 v2

摘要

尽管近期取得了进展,文本到视频检索 (TVR) 仍受到诸多固有不确定性的制约,包括模糊文本查询、文本视频映射模糊以及低质量视频帧。虽然交互式系统涌现出来用于通过澄清问题细化用户意图来解决这些挑战,但当前方法通常依赖经验或 ad-hoc 策略,未明确量化这些不确定性,限制了其有效性。鼓励此 gap 的动力下,我们提出 UMIVR,即基于不确定性最小化的交互式文本到视频检索框架,通过原则且无需训练的度量方法明确量化三个关键不确定性——文本歧义、映射不确定性和帧不确定性——分别通过基于语义熵的文本歧义得分 (TAS)、基于 Jensen-Shannon 发散的映射不确定性得分 (MUS) 以及基于时间质量的帧采样器 (TQFS)。通过这些不确定性措施引导自适应生成针对性澄清问题,UMIVR 在迭代细化用户查询方面显著减少检索歧义。大量实验在多个基准数据集上验证了 UMIVR 的有效性,在 MSR-VTT-1k 数据集上实现了在 10 次交互轮次后 Recall@1 达到 69.2% 的显著提升,从而为交互式 TVR 建立了不确定性最小化的基础。

关键词

引用

@article{arxiv.2507.15504,
  title  = {Quantifying and Narrowing the Unknown: Interactive Text-to-Video Retrieval via Uncertainty Minimization},
  author = {Bingqing Zhang and Zhuo Cao and Heming Du and Yang Li and Xue Li and Jiajun Liu and Sen Wang},
  journal= {arXiv preprint arXiv:2507.15504},
  year   = {2025}
}

备注

Accepted by ICCV 2025