中文

DNA:面向细粒度类别发现的去噪邻域聚合

机器学习 2023-10-17 v1 计算与语言 信息检索

摘要

从粗标注数据中发现细粒度类别是一项实用且具有挑战性的任务,能够弥合细粒度分析需求与高标注成本之间的差距。以往工作主要关注实例级判别以学习低级特征,却忽略了数据之间的语义相似性,这可能阻碍模型学习紧凑的聚类表示。本文提出去噪邻域聚合(Denoised Neighborhood Aggregation, DNA),一种将数据的语义结构编码到嵌入空间中的自监督框架。具体而言,我们检索查询的 k 近邻作为正样本键以捕获数据间的语义相似性,随后聚合来自邻居的信息以学习紧凑的聚类表示,从而使细粒度类别更具可分离性。然而,检索到的邻居可能含有噪声并包含许多假正样本键,这会降低所学嵌入的质量。为应对该挑战,我们提出三条原则来过滤这些假邻居以获得更好的表示学习。此外,我们从理论上证明本框架的学习目标等价于一种聚类损失,能够捕获数据间的语义相似性以形成紧凑的细粒度簇。在三个基准数据集上的大量实验表明,我们的方法能检索更准确的邻居(准确率提升 21.31%),并以较大优势超越最先进模型(三项指标平均提升 9.96%)。我们的代码与数据见 https://github.com/Lackel/DNA。

关键词

引用

@article{arxiv.2310.10151,
  title  = {DNA: Denoised Neighborhood Aggregation for Fine-grained Category Discovery},
  author = {Wenbin An and Feng Tian and Wenkai Shi and Yan Chen and Qinghua Zheng and QianYing Wang and Ping Chen},
  journal= {arXiv preprint arXiv:2310.10151},
  year   = {2023}
}

备注

Accepted by EMNLP 2023 Main