基于稳健视觉特征与高级注意力机制的多标签原子活动识别提升 @ ROAD++ 2024 原子活动识别
计算机视觉与模式识别
2024-10-22 v1
摘要
Road++ Track3 提出了一个在交通情景中的多标签原子活动识别任务,可标准化为一个 64 类的多标签视频动作识别任务。在多标签原子活动识别任务中,视觉特征提取的鲁棒性仍是关键挑战,这直接影响模型性能和泛化能力。为应对这些问题,我们团队对三个方面进行了优化:数据处理、模型和后处理。首先,选择合适的分辨率和视频抽样策略,并在验证和测试集上设置固定抽样策略。其次,针对模型训练,团队选择了多种视觉主干网络进行特征提取,然后引入在训练和验证集上训练、在测试集上推理的动作槽模型。最后,对于后处理,团队综合不同模型的优势与不足进行加权融合,测试集的最终 mAP 为 58%,比挑战基线高出 4%。
引用
@article{arxiv.2410.16037,
title = {Improving the Multi-label Atomic Activity Recognition by Robust Visual Feature and Advanced Attention @ ROAD++ Atomic Activity Recognition 2024},
author = {Jiamin Cao and Lingqi Wang and Kexin Zhang and Yuting Yang and Licheng Jiao and Yuwei Guo},
journal= {arXiv preprint arXiv:2410.16037},
year = {2024}
}