面向半监督时序动作定位的训练-测试一致性
计算机视觉与模式识别
2020-03-24 v3
摘要
近年来,弱监督时序动作定位(WTAL)已被广泛研究,但弱监督模型与全监督模型之间仍存在较大差距。标注少量样本的时间边界并利用它们帮助 WTAL 模型更好地检测动作是实用且直观的。然而,动作定位策略的训练-测试差异阻碍了 WTAL 模型利用半监督实现进一步改进。在训练时,使用注意力或多示例学习来聚合每个片段的预测以进行视频级分类;在测试时,它们首先获得随时间变化的动作分数序列,然后截断高于固定阈值的分数段,并对动作片段进行后处理。这种不一致的策略使得在训练时难以用时间边界标注显式监督动作定位模型。在本文中,我们提出了一个训练-测试一致框架 TTC-Loc。在训练和测试时,我们的 TTC-Loc 通过比较动作类别分数与预测阈值来定位动作,这使其能够在半监督下训练。通过消除训练-测试差异,当仅提供视频级标签用于训练时,我们的 TTC-Loc 在 THUMOS'14、ActivityNet 1.2 和 1.3 上显著优于最先进性能。每类仅一个视频的全标注及其余视频的视频级标签下,我们的 TTC-Loc 进一步提升了性能,并在 THUMOS's 14 上达到 33.4% mAP(IoU 阈值 0.5)。
引用
@article{arxiv.1910.11285,
title = {Towards Train-Test Consistency for Semi-supervised Temporal Action Localization},
author = {Xudong Lin and Zheng Shou and Shih-Fu Chang},
journal= {arXiv preprint arXiv:1910.11285},
year = {2020}
}
备注
Work in progress