超越视觉相似性:显式领域规则引导的多模态聚类
机器学习
2025-09-26 v1 计算机视觉与模式识别
摘要
传统聚类技术通常仅依赖输入数据中的相似性,限制了其捕捉许多领域中至关重要的结构或语义约束的能力。我们提出了领域感知规则触发变分自编码器(DARTVAE),一种规则引导的多模态聚类框架,将领域特定的约束直接嵌入表示学习过程。DARTVAE通过将显式规则、语义表示和数据驱动特征嵌入统一的潜在空间来扩展VAE架构,同时通过损失函数中的规则一致性和违反惩罚来强制约束合规。与仅依赖视觉相似性或将规则作为事后过滤器的传统聚类方法不同,DARTVAE将规则视为一等学习信号。规则由LLM生成,结构化为知识图谱,并通过结合重构、KL散度、一致性和违反惩罚的损失函数来强制执行。在飞机和汽车数据集上的实验表明,规则引导聚类产生了更具操作意义和可解释性的聚类结果,例如分离无人机、统一隐身飞机或区分SUV与轿车,同时改善了传统聚类指标。然而,该框架面临挑战:LLM生成的规则可能产生幻觉或冲突,过多的规则可能导致过拟合,且扩展到复杂领域会增加计算和一致性方面的困难。通过将规则编码与学习表示相结合,DARTVAE实现了比纯数据驱动模型更有意义和更一致的聚类结果,突显了约束引导多模态聚类在复杂、知识密集型设置中的效用。
引用
@article{arxiv.2509.20501,
title = {Beyond Visual Similarity: Rule-Guided Multimodal Clustering with explicit domain rules},
author = {Kishor Datta Gupta and Mohd Ariful Haque and Marufa Kamal and Ahmed Rafi Hasan and Md. Mahfuzur Rahman and Roy George},
journal= {arXiv preprint arXiv:2509.20501},
year = {2025}
}
备注
12 pages, 9 figures