中文

ReTabAD:恢复表格异常检测中语义上下文的基准

人工智能 2025-10-03 v1 机器学习

摘要

在表格异常检测 (AD) 中,文本语义通常携带关键信号,因为异常的定义与特定领域的上下文密切相关。然而,现有的基准仅提供没有语义上下文的原始数据点,忽略了专家在实践中依赖的丰富文本元数据(如特征描述和领域知识)。这一限制制约了研究的灵活性,并阻碍了模型充分利用领域知识进行检测。ReTabAD 通过恢复文本语义来填补这一空白,以支持上下文感知的表格 AD 研究。我们提供了: 20 个精心策划的表格数据集,其中包含丰富的结构化文本元数据,并附带了包括经典方法、深度学习方法和基于 LLM 方法在内的最先进 AD 算法的实现; 一个无需特定任务训练即可利用语义上下文的零样本 LLM 框架,为未来研究确立了强大的基线。此外,本工作通过实验与分析探讨了文本元数据在 AD 中的作用与效用。结果表明,语义上下文通过支持领域感知推理提升了检测性能并增强了可解释性。这些发现确立了 ReTabAD 作为系统探索上下文感知 AD 的基准。

关键词

引用

@article{arxiv.2510.02060,
  title  = {ReTabAD: A Benchmark for Restoring Semantic Context in Tabular Anomaly Detection},
  author = {Sanghyu Yoon and Dongmin Kim and Suhee Yoon and Ye Seul Sim and Seungdong Yoa and Hye-Seung Cho and Soonyoung Lee and Hankook Lee and Woohyung Lim},
  journal= {arXiv preprint arXiv:2510.02060},
  year   = {2025}
}

备注

9 pages, 4 figures