用于动作分割的时间段 Transformer
计算机视觉与模式识别
2023-02-28 v1
摘要
从未裁剪视频中识别人类动作是活动理解中的一项重要任务,并在建模长程时间关系方面带来独特挑战。近期工作采用预测-精炼策略,将初始预测转换为动作段以进行全局上下文建模。然而,生成的段表示往往含有噪声,并表现出段边界不准确、过分割及其他问题。为解决这些问题,我们提出一种基于注意力的方法,称为时间段 Transformer(temporal segment transformer),用于联合段关系建模与去噪。其核心思想是利用段表示与帧表示之间的注意力对段表示去噪,并利用段间注意力捕捉段之间的时间相关性。精炼后的段表示用于预测动作标签并调整段边界,最终基于段掩码的投票产生动作分割结果。我们表明,这一新颖架构在流行的 50Salads、GTEA 和 Breakfast 基准上达到了最先进的精度。我们还进行了大量消融实验,以证明设计中不同组件的有效性。
引用
@article{arxiv.2302.13074,
title = {Temporal Segment Transformer for Action Segmentation},
author = {Zhichao Liu and Leshan Wang and Desen Zhou and Jian Wang and Songyang Zhang and Yang Bai and Errui Ding and Rui Fan},
journal= {arXiv preprint arXiv:2302.13074},
year = {2023}
}