中文

可解释的长期动作质量评估

计算机视觉与模式识别 2024-08-22 v1

摘要

长期动作质量评估(AQA)评估视频中活动的执行情况。然而,时长给细粒度可解释性带来了挑战,当前的AQA方法通常通过对片段特征取平均来产生单一分数,缺乏单个片段的详细语义含义。由于动作的复杂性和多样性,长期视频带来了额外的困难,加剧了可解释性的挑战。虽然基于查询的Transformer网络提供了有前景的长期建模能力,但它们在AQA中的可解释性仍然不尽如人意,这是由于我们称之为时间跳跃(Temporal Skipping)的现象,即模型跳过自注意力层以防止输出退化。为了解决这个问题,我们提出了一种注意力损失函数和一种查询初始化方法,以增强性能和可解释性。此外,我们引入了一个权重-分数回归模块,旨在近似人类判断中的评分模式,并取代传统的单一分数回归,提高了可解释性的合理性。我们的方法在三个真实世界的长期AQA基准测试中取得了最先进的结果。我们的代码可在https://github.com/dx199771/Interpretability-AQA获取。

关键词

引用

@article{arxiv.2408.11687,
  title  = {Interpretable Long-term Action Quality Assessment},
  author = {Xu Dong and Xinran Liu and Wanqing Li and Anthony Adeyemi-Ejeye and Andrew Gilbert},
  journal= {arXiv preprint arXiv:2408.11687},
  year   = {2024}
}

备注

Accepted to British Machine Vision Conference (BMVC) 2024