基于轨迹段聚类的视频实体发现时间一致性贝叶斯模型
计算机视觉与模式识别
2015-02-09 v2
摘要
视频可表示为轨迹段(tracklet)序列,每个轨迹段跨越 10-20 帧并与一个实体(例如一个人)相关联。视频中的实体发现(Entity Discovery)任务可自然地表述为轨迹段聚类。我们利用时间一致性(Temporal Coherence, TC)来处理此任务:这是视频的基本属性,即每个轨迹段很可能与其时间邻域内的轨迹段关联到同一实体。我们的主要贡献是提出了首个轨迹段层面的时间一致性贝叶斯非参数模型。我们扩展中国餐馆过程(Chinese Restaurant Process, CRP)提出了 TC-CRP,并进一步扩展为时间一致性中国餐馆联盟(Temporally Coherent Chinese Restaurant Franchise, TC-CRF)以联合建模短时间片段。在无需剧本等元数据的情况下发现电视连续视频中人物的任务上,与现有的轨迹段聚类最先进方法相比,这些方法在聚类纯度和人物覆盖率方面显示出显著改进。我们用混合分量表示实体,用非常通用的特征向量表示轨迹段,该方法适用于任何类型的实体(不一定是人)。与现有方法不同,所提出的方法可在流媒体视频上执行在线轨迹段聚类且性能下降极小,并能自动拒绝由错误检测产生的轨迹段。最后,我们讨论了实体驱动的视频摘要——即根据发现的实体自动选择视频的某些时间片段。
引用
@article{arxiv.1409.6080,
title = {Temporally Coherent Bayesian Models for Entity Discovery in Videos by Tracklet Clustering},
author = {Adway Mitra and Soma Biswas and Chiranjib Bhattacharyya},
journal= {arXiv preprint arXiv:1409.6080},
year = {2015}
}
备注
11 pages