用于参与度强度预测的类别注意力视频 Transformer
计算机视觉与模式识别
2022-11-11 v2 机器学习
摘要
为处理变长长视频,已有工作提取多模态特征并融合以预测学生参与度强度。本文提出一种新的端到端方法——视频 Transformer 中的类别注意力(CavT),其引入单一向量处理类别嵌入,并在变长长视频与定长短视频上统一执行端到端学习。此外,针对训练样本不足的问题,我们提出二值序代表采样方法(BorS),为每视频增加多个视频序列以扩充训练集。BorS+CavT 不仅在 EmotiW-EP 数据集上取得 SOTA 的 MSE(0.0495),也在 DAiSEE 数据集上获得 SOTA 的 MSE(0.0377)。代码与模型已公开于 https://github.com/mountainai/cavt。
引用
@article{arxiv.2208.07216,
title = {Class-attention Video Transformer for Engagement Intensity Prediction},
author = {Xusheng Ai and Victor S. Sheng and Chunhua Li and Zhiming Cui},
journal= {arXiv preprint arXiv:2208.07216},
year = {2022}
}
备注
5 figures