SAVeD:语义感知版本发现
机器学习
2026-01-13 v2 机器学习
摘要
我们的工作引入了 SAVeD(Semantically Aware Version Detection),这是一个基于对比学习的框架,用于在不依赖元数据、标签或集成假设的情况下识别结构化数据集的版本。SAVeD 解决了数据科学中因难以区分相似工作或转换导致的重复劳动的常见挑战。SAVeD 采用修改后的 SimCLR 流程,通过随机变换(例如行删除、编码扰动)生成表格视图。这些视图通过自定义转换器编码器嵌入并在潜在空间中对比,以优化语义相似性。我们的模型学习最小化同一数据集的增强视图之间的距离,并最大化无关表格之间的距离。我们使用验证准确率和分离度进行评估,后者分别定义为在保留样本集上正确分类的版本/非版本对的比例,以及版本化表格与非版本化表格之间平均相似度差(由基准决定,模型未见)的差值。我们的实验涵盖语义版本数据库基准中的五个经典数据集,显示出显著的训练后提升。SAVeD 在完全未见的表格上实现了显著更高的准确率,并在分离度上实现显著提升,确认了其区分语义改变版本的能力。与未训练的基线和先前的状态-of-the-art 数据集发现方法(如 Starmie)相比,我们的自定义编码器实现了竞争甚至优于结果。
引用
@article{arxiv.2511.17298,
title = {SAVeD: Semantic Aware Version Discovery},
author = {Artem Frenk and Roee Shraga},
journal= {arXiv preprint arXiv:2511.17298},
year = {2026}
}
备注
11 pages, 6 figures