中文

少即多:用于稠密反应预测的稀疏采样

计算机视觉与模式识别 2021-06-04 v1

摘要

从视频中获取观众响应,有助于创作者与流媒体平台分析视频表现并改善未来用户体验。在本报告中,我们介绍用于 2021 年 Evoked Expression from Videos Challenge 的方法。具体而言,我们的模型以音频与图像两种模态作为输入,预测观众的情绪变化。为建模长程情绪变化,我们使用基于 GRU 的模型以 1Hz 预测一个稀疏信号。我们观察到情绪变化是平滑的,因此最终稠密预测通过对该信号进行线性插值获得,其对预测波动具有鲁棒性。尽管简单,所提方法在最终私有测试集上取得了 0.04430 的皮尔逊相关系数分数。

关键词

引用

@article{arxiv.2106.01764,
  title  = {Less is More: Sparse Sampling for Dense Reaction Predictions},
  author = {Kezhou Lin and Xiaohan Wang and Zhedong Zheng and Linchao Zhu and Yi Yang},
  journal= {arXiv preprint arXiv:2106.01764},
  year   = {2021}
}

备注

Code is available at: https://github.com/HenryLittle/EEV-Challenge-2021