基于最优传输的折中度量少样本动作识别
计算机视觉与模式识别
2021-04-09 v1 人工智能
机器学习
摘要
尽管对计算机系统至关重要,少样本动作识别仍不成熟,尽管少样本图像分类已被广泛研究。流行的少样本学习算法从已见类提取可迁移嵌入,并通过构建基于度量的分类器在未见类上复用。将这些算法应用于动作识别的主要障碍是视频的复杂结构。一些现有方案从视频采样帧并聚合其嵌入以形成视频级表示,忽略了重要的时间关系。另一些方案在两视频间执行显式序列匹配,并将距离定义为匹配代价,对序列顺序施加了过强约束。本文提出基于最优传输的折中度量(CMOT)以结合这两类方案的优势。CMOT 在最优传输框架下同时考虑视频的语义与时间信息,对内容敏感与顺序敏感任务均具判别力。具体而言,给定两视频,我们从中采样片段,并将它们距离的计算转化为两片段序列间的最优传输问题。为保留固有时间顺序信息,我们额外通过对片段对的位置距离施加惩罚来修正地面代价矩阵。在基准数据集上的实证结果展示了 CMOT 的优越性。
引用
@article{arxiv.2104.03737,
title = {Few-Shot Action Recognition with Compromised Metric via Optimal Transport},
author = {Su Lu and Han-Jia Ye and De-Chuan Zhan},
journal= {arXiv preprint arXiv:2104.03737},
year = {2021}
}