协作学习环境中的说话检测
计算机视觉与模式识别
2021-10-18 v1 图像与视频处理
摘要
我们研究在协作学习视频中检测说话活动的问题。我们的方法使用头部检测和光流向量的对数幅度投影,将问题简化为对小投影图像的简单分类,而无需训练复杂的三维活动分类系统。然后,使用标准分类器的简单多数投票即可轻松对这些小投影图像进行分类。对于说话检测,我们提出的方法被证明显著优于单一活动系统。我们的总体准确率为59%,而时间片段网络(TSN)为42%,卷积三维网络(C3D)为45%。此外,我们的方法能够检测来自多个说话者的多个说话实例,同时也能检测说话者本身。
引用
@article{arxiv.2110.07646,
title = {Talking Detection In Collaborative Learning Environments},
author = {Wenjing Shi and Marios S. Pattichis and Sylvia Celedón-Pattichis and Carlos LópezLeiva},
journal= {arXiv preprint arXiv:2110.07646},
year = {2021}
}