中文

基于最优传输的折中度量少样本动作识别

计算机视觉与模式识别 2021-04-09 v1 人工智能 机器学习

摘要

尽管对计算机系统至关重要,少样本动作识别仍不成熟,尽管少样本图像分类已被广泛研究。流行的少样本学习算法从已见类提取可迁移嵌入,并通过构建基于度量的分类器在未见类上复用。将这些算法应用于动作识别的主要障碍是视频的复杂结构。一些现有方案从视频采样帧并聚合其嵌入以形成视频级表示,忽略了重要的时间关系。另一些方案在两视频间执行显式序列匹配,并将距离定义为匹配代价,对序列顺序施加了过强约束。本文提出基于最优传输的折中度量(CMOT)以结合这两类方案的优势。CMOT 在最优传输框架下同时考虑视频的语义与时间信息,对内容敏感与顺序敏感任务均具判别力。具体而言,给定两视频,我们从中采样片段,并将它们距离的计算转化为两片段序列间的最优传输问题。为保留固有时间顺序信息,我们额外通过对片段对的位置距离施加惩罚来修正地面代价矩阵。在基准数据集上的实证结果展示了 CMOT 的优越性。

关键词

引用

@article{arxiv.2104.03737,
  title  = {Few-Shot Action Recognition with Compromised Metric via Optimal Transport},
  author = {Su Lu and Han-Jia Ye and De-Chuan Zhan},
  journal= {arXiv preprint arXiv:2104.03737},
  year   = {2021}
}