基于混合时间域自适应的动作分割
计算机视觉与模式识别
2021-04-19 v2 人工智能
机器学习
摘要
动作分割的主要进展来自于用于全监督学习的密集标注数据。由于帧级动作的手动标注耗时且具有挑战性,我们提出利用更易获取的辅助无标签视频,将这一问题塑造为域自适应(DA)问题。尽管近年来已提出多种DA技术,但其中大多数仅针对空间方向开发。因此,我们提出混合时间域自适应(MTDA),以联合对齐跨域的帧级和视频级嵌入特征空间,并进一步与域注意力机制结合,聚焦于对齐具有更高域差异的帧级特征,从而实现更有效的域自适应。最后,我们在三个具有挑战性的数据集(GTEA、50Salads和Breakfast)上评估了所提方法,并验证MTDA在所有三个数据集上均以大幅优势优于当前最先进(SOTA)方法(例如GTEA上F1@50提升6.4%,编辑分数提升6.8%)。
引用
@article{arxiv.2104.07461,
title = {Action Segmentation with Mixed Temporal Domain Adaptation},
author = {Min-Hung Chen and Baopu Li and Yingze Bao and Ghassan AlRegib},
journal= {arXiv preprint arXiv:2104.07461},
year = {2021}
}
备注
Winter Conference on Applications of Computer Vision (WACV) 2020. Website: https://minhungchen.netlify.app/publication/mtda