中文

AdaSpot: 在关键位置进行精确事件定位

计算机视觉与模式识别 2026-02-26 v1

摘要

精确事件定位旨在以高时间精度定位视频中的快速动作或事件, 是体育分析、机器人和自动驾驶系统中的关键任务。现有方法通常对所有帧以相同方式处理, 忽视了视频数据中固有的时空冗余。这导致在非信息丰富的区域进行冗余计算, 同时限制了整体效率。为保持可行性, 这些方法往往在空间上进行下采样, 丢失关键用于精确定位的细粒度细节。为解决这些限制, 本文提出 AdaSpot 框架: 该框架先对低分辨率视频进行处理以提取全局任务相关特征,随后自适应选择每帧中最具信息量的感兴趣区域(ROI)进行高分辨率处理。该选择通过无监督、任务感知的方式实现, 维持帧与帧之间的时空一致性, 避免可学习方法的训练不稳定。该设计在仅略增计算开销的情况下保留关键细粒度视觉线索, 远高于统一高分辨率处理的效率。在标准 PES 基准测试上, AdaSpot 实现了严格评估指标下的状态机性能(如在网球赛和 FineDiving 上的分别提升 3.963.962.262.26 mAP@0@0 帧),同时在宽松指标下也保持良好成绩。代码已公开: \href{https://github.com/arturxe2/AdaSpot}{https://github.com/arturxe2/AdaSpot}。

关键词

引用

@article{arxiv.2602.22073,
  title  = {AdaSpot: Spend Resolution Where It Matters for Precise Event Spotting},
  author = {Artur Xarles and Sergio Escalera and Thomas B. Moeslund and Albert Clapés},
  journal= {arXiv preprint arXiv:2602.22073},
  year   = {2026}
}