面向多模态人物聚类的关联感知分布表示网络
计算机视觉与模式识别
2023-08-02 v1 多媒体
摘要
利用包括人脸、人体和声音在内的多模态线索进行人物聚类,对于诸如电影解析和基于身份的电影编辑等多种任务至关重要。多视图聚类等相关方法主要将多模态特征投影到联合特征空间中。然而,由于模态特有性带来的语义鸿沟,多模态线索特征通常相关性相当弱。因此,这些方法并不适用于人物聚类。本文中,我们提出一种关联感知分布表示网络(RAD-Net)来生成多模态线索的分布表示。一个线索的分布表示是由该线索与来自所有模态的其他所有线索之间的关系构成的向量,因而与模态无关且利于人物聚类。相应地,我们引入一种基于图的方法构建分布表示,并采用循环更新策略逐步精炼分布表示。我们的方法在Video Person-Clustering Dataset(VPCD)和VoxCeleb2多视图聚类数据集上分别取得了F-score上+6%和+8.2%的显著提升。代码将在录用后公开。
引用
@article{arxiv.2308.00588,
title = {Relation-Aware Distribution Representation Network for Person Clustering with Multiple Modalities},
author = {Kaijian Liu and Shixiang Tang and Ziyue Li and Zhishuai Li and Lei Bai and Feng Zhu and Rui Zhao},
journal= {arXiv preprint arXiv:2308.00588},
year = {2023}
}
备注
Accepted in IEEE Transactions on Multimedia