中文

基于相关性与特异性的在线视频-文本数据流过滤框架

计算机视觉与模式识别 2025-04-22 v1 人工智能 机器学习

摘要

视频-文本数据的快速增长给训练过程中的存储与计算带来了挑战。在线学习通过实时处理流式数据,为这些问题提供了可行的解决方案,同时也允许在需要实时响应的场景中进行快速适应。提高学习效率和效果的一个策略是识别并优先处理能提升目标下游任务性能的数据。我们提出了基于相关性与特异性的在线过滤框架(ReSpec),依据四个准则选择数据:(i)模态对齐用于干净数据,(ii)任务相关性用于目标聚焦数据,(iii)特异性用于信息丰富且细节丰富的数据,(iv)效率用于低延迟处理。相关性由输入数据与下游任务之间的概率对齐程度决定,而特异性则采用距离根嵌入(代表最不具特异性的数据)的距离作为信息丰富性的高效代理。通过建立目标任务数据的参考点,ReSpec在实时过滤输入数据,无需大量存储和计算。评估于WebVid2M和VideoCC3M等大规模数据集,ReSpec在五个零样本视频检索任务中实现了最先进的性能,仅使用5%的数据即可实现,计算开销最小。源代码已公开:https://github.com/cdjkim/ReSpec。

关键词

引用

@article{arxiv.2504.14875,
  title  = {ReSpec: Relevance and Specificity Grounded Online Filtering for Learning on Video-Text Data Streams},
  author = {Chris Dongjoo Kim and Jihwan Moon and Sangwoo Moon and Heeseung Yun and Sihaeng Lee and Aniruddha Kembhavi and Soonyoung Lee and Gunhee Kim and Sangho Lee and Christopher Clark},
  journal= {arXiv preprint arXiv:2504.14875},
  year   = {2025}
}

备注

CVPR 2025 (main conference)