可解释的长期动作质量评估
计算机视觉与模式识别
2024-08-22 v1
摘要
长期动作质量评估(AQA)评估视频中活动的执行情况。然而,时长给细粒度可解释性带来了挑战,当前的AQA方法通常通过对片段特征取平均来产生单一分数,缺乏单个片段的详细语义含义。由于动作的复杂性和多样性,长期视频带来了额外的困难,加剧了可解释性的挑战。虽然基于查询的Transformer网络提供了有前景的长期建模能力,但它们在AQA中的可解释性仍然不尽如人意,这是由于我们称之为时间跳跃(Temporal Skipping)的现象,即模型跳过自注意力层以防止输出退化。为了解决这个问题,我们提出了一种注意力损失函数和一种查询初始化方法,以增强性能和可解释性。此外,我们引入了一个权重-分数回归模块,旨在近似人类判断中的评分模式,并取代传统的单一分数回归,提高了可解释性的合理性。我们的方法在三个真实世界的长期AQA基准测试中取得了最先进的结果。我们的代码可在https://github.com/dx199771/Interpretability-AQA获取。
引用
@article{arxiv.2408.11687,
title = {Interpretable Long-term Action Quality Assessment},
author = {Xu Dong and Xinran Liu and Wanqing Li and Anthony Adeyemi-Ejeye and Andrew Gilbert},
journal= {arXiv preprint arXiv:2408.11687},
year = {2024}
}
备注
Accepted to British Machine Vision Conference (BMVC) 2024