随机时间变形中的注意力机制
计算机视觉与模式识别
2025-08-25 v1
摘要
本文揭示了我们可以将随机时间变形(Randomized Time Warping, RTW)的基本功能解释为一种自注意力机制,这是变形器(Transformer)在运动识别中核心技术。自注意力机制使模型能够识别和衡量输入序列模式中不同部分的重要性。另一方面,RTW是动态时间变形(Dynamic Time Warping, DTW)的一个通用扩展,DTW是常用于匹配和比较序列模式的技术。本质上,RTW搜索为输入序列模式的每个元素寻找最佳贡献权重,以产生判别性特征。尽管这两种方法看起来不同,这些贡献权重可以被解释为自注意力权重。事实上,这两种权重模式看起来相似,在十个最小的标准角度之间产生了0.80的平均相关性。然而,它们以不同方式工作:RTW注意力作用于整个输入序列模式,而自注意力只关注局部视图,这是输入序列模式的一个子集,因为自注意力矩阵的计算成本。这种针对性差异导致了RTW相对于变形器的优势,如下文在Something-Something V2数据集上5%性能提升所示。
引用
@article{arxiv.2508.16366,
title = {Attention Mechanism in Randomized Time Warping},
author = {Yutaro Hiraoka and Kazuya Okamura and Kota Suto and Kazuhiro Fukui},
journal= {arXiv preprint arXiv:2508.16366},
year = {2025}
}
备注
Accepted to IEEE ICIP 2025 Workshops