中文

ContextRefine-CLIP 用于 EPIC-KITCHENS-100 多实例检索挑战赛 2025

计算机视觉与模式识别 2025-06-13 v1

摘要

本报告提出 ContextRefine-CLIP(CR-CLIP),一种用于视觉-文本多实例检索任务的高效模型。该方法基于双编码器 AVION,我们引入跨模态注意力流模块以实现视觉和文本特征之间的双向动态交互与精炼,从而生成更具上下文感知的联合表征。对于 EPIC-KITCHENS-100 等任务中提供的软标签相关性矩阵,CR-CLIP 可以结合对称多相似性损失(Symmetric Multi-Similarity Loss),利用精炼后的特征实现更准确的语义对齐与优化。无需集成学习,CR-CLIP 模型在 EPIC-KITCHENS-100 公开排行榜上达到 66.78 mAP 和 82.08 nDCG,显著优于基线模型,充分验证了其在跨模态检索中的有效性。代码将在 https://github.com/delCayr/ContextRefine-Clip 开源发布。

关键词

引用

@article{arxiv.2506.10550,
  title  = {ContextRefine-CLIP for EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge 2025},
  author = {Jing He and Yiqing Wang and Lingling Li and Kexin Zhang and Puhua Chen},
  journal= {arXiv preprint arXiv:2506.10550},
  year   = {2025}
}