CoSeg:受认知启发无监督通用事件分割
计算机视觉与模式识别
2021-10-01 v1 多媒体
摘要
一些认知研究发现,人类将事件分割作为事件预期的一种副作用来完成。受此发现启发,我们提出了一种简单而有效的端到端自监督学习框架,用于事件分割/边界检测。与主流的基于聚类的方法不同,我们的框架利用基于 transformer 的特征重建方案,通过重建误差来检测事件边界。这与人类利用自身预测与实际感知之间的偏差来发现新事件的事实一致。由于边界处帧在语义上的异质性,它们难以被重建(通常具有较大重建误差),这有利于事件边界检测。此外,由于重建发生在语义特征层面而非像素层面,我们开发了时间对比特征嵌入模块,以学习用于帧特征重建的语义视觉表示。此过程类似于人类用“长期记忆”建立经验。我们工作的目标是分割通用事件而非定位某些特定事件。我们专注于实现准确的事件边界。因此,我们采用 F1 分数(精确率/召回率)作为与先前方法公平比较的主要评价指标。同时,我们也计算了常规的基于帧的 MoF 和 IoU 指标。我们在四个公开可用数据集上对我们的工作进行了充分基准测试,并展示了好得多的结果。
引用
@article{arxiv.2109.15170,
title = {CoSeg: Cognitively Inspired Unsupervised Generic Event Segmentation},
author = {Xiao Wang and Jingen Liu and Tao Mei and Jiebo Luo},
journal= {arXiv preprint arXiv:2109.15170},
year = {2021}
}