基于概率分布学习和区间聚类细化的Few-shot Multiple Instances Temporal Action Localization (FMI-TAL)
计算机视觉与模式识别
2024-08-27 v1
摘要
当前的few-shot时序动作局部化模型无法处理视频包含多个动作实例的情况。因此,本文旨在利用有限数量的修剪支持视频,在冗长未剪辑的查询视频中实现多个动作实例的定位。为有效解决这一挑战性问题,我们提出了一种新方法,涉及带有概率学习和聚类细化的空间-通道关系转换器。该方法能够准确识别查询视频中动作的起始和结束边界,仅需少量标记视频。我们提出的方法擅长捕获时序和空间上下文,从而有效地对视频中的动作进行分类和精确定位,使我们能够更全面地利用这些关键细节。所设计的选择性余弦惩罚算法用于抑制不包含动作场景切换的时序边界。结合概率学习和标签生成算法的做法缓解了动作时长多样性问题,增强了模型处理模糊动作边界的能力。区间聚类有助于我们获取在few-shot时序动作局部化中处理多个实例情形的最终结果。我们的模型通过严格的实验在基准数据集ActivityNet1.3和THUMOS14上实现了有竞争力的性能。我们的代码可在https://github.com/ycwfs/FMI-TAL上获取。
关键词
引用
@article{arxiv.2408.13765,
title = {FMI-TAL: Few-shot Multiple Instances Temporal Action Localization by Probability Distribution Learning and Interval Cluster Refinement},
author = {Fengshun Wang and Qiurui Wang and Yuting Wang},
journal= {arXiv preprint arXiv:2408.13765},
year = {2024}
}
备注
9 pages, 3 figures