DGME-T:基于 Transformer 的历史摄像机运动分类中的方向性网格运动编码
计算机视觉与模式识别
2025-10-20 v1 人工智能
图像与视频处理
摘要
摄像机运动分类(CMC)模型是在当代高质量影片上训练的模型在应用于档案影片时常会退化,因为噪声、缺失帧以及低对比度会遮蔽运动线索。我们通过整合两个现代语料库到四个标准类别,并将 HISTORIAN 语料库重新结构化为五个平衡类别来弥合这一差距。基于此基准,我们引入 DGME-T,这是一种针对 Video Swin Transformer 的轻量级扩展,通过可学习的归一化晚期融合层注入由光流派生的方向性网格运动编码。DGME-T 将 backbone 的 Top-1 准确率从 81.78% 提升至 86.14%,宏观 F1 分数从 82.08% 提升至 87.81%(在现代短片上),同时仍对要求严苛的二战影片将准确率从 83.43% 提升至 84.62%,宏观 F1 分数从 81.72% 提升至 82.63%。进一步的跨域研究表明,在现代数据上进行中间微调可使历史类数据性能提升超过五个百分点。这些结果表明,结构化运动先验与 Transformer 表示是互补的,即使是一个小且经过精心校准的运动头部也能在退化影像分析中显著增强鲁棒性。相关资源请访问 https://github.com/linty5/DGME-T。
引用
@article{arxiv.2510.15725,
title = {DGME-T: Directional Grid Motion Encoding for Transformer-Based Historical Camera Movement Classification},
author = {Tingyu Lin and Armin Dadras and Florian Kleber and Robert Sablatnig},
journal= {arXiv preprint arXiv:2510.15725},
year = {2025}
}
备注
9 pages, accepted at ACMMM2025 SUMAC