中文

U-CESE: 统一基于 Clip 的事件搜索引擎用于 AI 挑战 HCMC 2025

计算机视觉与模式识别 2026-05-25 v1

摘要

从大规模视频数据集中检索事件因其复杂的时序、空间和多模态信息而具有挑战性。本文提出 U-CESE,我们的解决方案用于 AI 挑战 HCMC 2025,这是一个用于多模态事件检索的统一 Clip-based 事件搜索引擎。基于 CESE,U-CESE 将其三个模块集成到单一的 cohesive 框架中,确保跨查询类型的一致处理和检索。核心组件是统一裁剪算法,将独立的裁剪算法合并为一个高效的管道。为处理大规模数据,我们提出 DAKE,这是一种轻量级、无训练的关键帧提取方法,使用 JPEG 文件大小变化来识别显著的场景变化。最后,我们引入 ReCap,受循环神经网络启发的时序一致性描述框架,生成详细且情境感知的文本描述。实验表明,U-CESE 在大规模多模态事件检索中提供了稳健、一致且高效的性能。

关键词

引用

@article{arxiv.2605.23274,
  title  = {U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025},
  author = {Duc-Nhuan Le and Hoang-Phuc Nguyen and Thanh-Duy Lam and Minh-Nhut Dang and Minh-Hoang Le},
  journal= {arXiv preprint arXiv:2605.23274},
  year   = {2026}
}

备注

Accepted for publication in the Proceedings of the 14th International Symposium on Information and Communication Technology (SOICT 2025)