少即多:用于稠密反应预测的稀疏采样
计算机视觉与模式识别
2021-06-04 v1
摘要
从视频中获取观众响应,有助于创作者与流媒体平台分析视频表现并改善未来用户体验。在本报告中,我们介绍用于 2021 年 Evoked Expression from Videos Challenge 的方法。具体而言,我们的模型以音频与图像两种模态作为输入,预测观众的情绪变化。为建模长程情绪变化,我们使用基于 GRU 的模型以 1Hz 预测一个稀疏信号。我们观察到情绪变化是平滑的,因此最终稠密预测通过对该信号进行线性插值获得,其对预测波动具有鲁棒性。尽管简单,所提方法在最终私有测试集上取得了 0.04430 的皮尔逊相关系数分数。
引用
@article{arxiv.2106.01764,
title = {Less is More: Sparse Sampling for Dense Reaction Predictions},
author = {Kezhou Lin and Xiaohan Wang and Zhedong Zheng and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2106.01764},
year = {2021}
}
备注
Code is available at: https://github.com/HenryLittle/EEV-Challenge-2021