面向个性化视觉多聚类的多模态代理学习
计算机视觉与模式识别
2024-04-25 v1
摘要
多聚类近年来因其能够从不同角度揭示数据的多个隐藏结构而受到广泛关注。深度多聚类技术的出现通过揭示大型数据集中的复杂模式和关系,显著提升了性能。然而,一个主要挑战是用户通常不需要算法生成的所有聚类,而找出所需聚类需要对每个聚类结果有深入理解。传统上,将用户简短的关键词兴趣与相应的视觉组件对齐是困难的,但多模态和大语言模型(LLM)的出现开始弥合这一差距。为此,针对未标记的目标视觉数据,我们提出Multi-MaP,一种采用多模态代理学习过程的新方法。它利用CLIP编码器提取连贯的文本和图像嵌入,并由GPT-4整合用户兴趣以制定有效的文本上下文。此外,设计了参考词约束和概念级约束,以根据用户兴趣学习最优文本代理。Multi-MaP不仅通过关键词巧妙捕捉用户兴趣,而且有助于识别相关聚类。我们的广泛实验表明,在所有基准多聚类视觉任务中,Multi-MaP始终优于最先进的方法。我们的代码可在https://github.com/Alexander-Yao/Multi-MaP获取。
引用
@article{arxiv.2404.15655,
title = {Multi-Modal Proxy Learning Towards Personalized Visual Multiple Clustering},
author = {Jiawei Yao and Qi Qian and Juhua Hu},
journal= {arXiv preprint arXiv:2404.15655},
year = {2024}
}
备注
Accepted by CVPR 2024. Project page: https://github.com/Alexander-Yao/Multi-MaP