中文

基于少样本与多任务对比学习的高效情感视频数据集标注

计算机视觉与模式识别 2023-08-07 v1 人机交互 多媒体

摘要

尽管深度学习技术已在情感预测上取得优异表现,它们仍需要大量标注训练数据,而这些数据(a)编纂繁琐枯燥,且(b)易出错并带有偏差。我们提出用于情感表征的多任务对比学习(MT-CLAR),以实现少样本情感推断。MT-CLAR将多任务学习与经对比学习训练的孪生网络相结合,从一对富有表现力的面部图像中推断(a)面部表情之间的(不)相似性,以及(b)两张人脸在效价与唤醒度上的差异。我们进一步将基于图像的MT-CLAR框架扩展用于自动化视频标注:给定一帧或少数几帧已标注视频帧(称为支持集),MT-CLAR为视频其余部分标注效价与唤醒度。我们在AFEW-VA数据集上以多种支持集配置进行了实验;此外,将在MT-CLAR上学得的表征用于监督学习,以在AffectNet与AFEW-VA数据集上预测效价、唤醒度及分类情绪。结果表明,经由MT-CLAR的效价与唤醒度预测与当前最优(SOTA)极为接近,且在支持集规模约为视频数据集6%时显著优于SOTA。

关键词

引用

@article{arxiv.2308.02173,
  title  = {Efficient Labelling of Affective Video Datasets via Few-Shot & Multi-Task Contrastive Learning},
  author = {Ravikiran Parameshwara and Ibrahim Radwan and Akshay Asthana and Iman Abbasnejad and Ramanathan Subramanian and Roland Goecke},
  journal= {arXiv preprint arXiv:2308.02173},
  year   = {2023}
}

备注

10 pages, 6 figures, to be published in Proceedings of the 31st ACM International Conference on Multimedia (MM '23)