中文

VERA:通过区域注释生成二维嵌入的视觉解释

机器学习 2026-05-01 v2 人机交互

摘要

通过MDS、t-SNE或UMAP等降维技术获得的二维嵌入被广泛用于可视化高维数据,并帮助研究人员在数据中直观地识别聚类、异常值和其他有趣的模式。然而,主要挑战不仅在于检测这些模式,还在于解释它们在原始、人类可解释的数据特征方面代表什么。现有方法通常依赖于交互式探索或直接特征编码,需要大量手动检查,这可能耗时且重复。作为替代方案,我们提出VERA(通过区域注释的视觉解释),一种通用方法,通过自动生成的、静态的、基于区域的视觉解释来解释二维嵌入。VERA识别嵌入空间中的信息区域,并将其与用户提供的人类可解释特征关联起来,生成简洁的视觉注释,一目了然地总结嵌入景观的结构。VERA不仅显示特征值出现的位置,还自动过滤、合并和排序候选解释,使用户无需手动探索即可专注于最具信息量的嵌入结构。我们在几个真实世界数据集上展示了VERA的实用性,并通过用户研究将其与全面的交互式数据挖掘工具包的实用性进行了比较。结果表明,VERA生成的静态解释能够传达复杂嵌入的基本见解,并支持用户完成典型的探索性数据分析任务,同时显著减少时间和用户工作量。

关键词

引用

@article{arxiv.2406.04808,
  title  = {VERA: Generating Visual Explanations of Two-Dimensional Embeddings via Region Annotation},
  author = {Pavlin G. Poličar and Blaž Zupan},
  journal= {arXiv preprint arXiv:2406.04808},
  year   = {2026}
}