中文

Forte:基于表示典型性估计寻找离群值

机器学习 2024-12-10 v2 人工智能 计算机视觉与模式识别 信息论 math.IT

摘要

生成模型现在能够产生与用于训练其真实数据几乎无istinguishable的照片逼真的合成数据。这标志着与以往能够产生训练数据合理模拟品的模型的重大演进;后者可以被人类评估区分于训练数据的视觉特征。在OOD检测的最新工作中,对生成模型似然值是否是最优OOD检测器提出了疑问,由于似然误估、生成过程中的熵以及典型性等问题。我们推测,生成式OOD检测器也失败了,因为它们的模型关注像素而非数据的语义内容,导致在像素可能相似但信息内容显著不同的近OOD案例中出现故障。我们假设,使用自监督学习器估计典型集可导致更好的OOD检测器。我们引入一种新方法,利用表示学习和基于流形估计的信息性概括统计量,以解决上述所有问题。我们的方法在各种真实数据集上超越其他无监督方法,在 established 挑战性基准测试和新的合成数据检测任务中实现了SOTA性能。

关键词

引用

@article{arxiv.2410.01322,
  title  = {Forte : Finding Outliers with Representation Typicality Estimation},
  author = {Debargha Ganguly and Warren Morningstar and Andrew Yu and Vipin Chaudhary},
  journal= {arXiv preprint arXiv:2410.01322},
  year   = {2024}
}