中文

极限情形下的对比识别与生成

机器学习 2026-05-08 v1 人工智能 计算与语言 数据结构与算法

摘要

在 Gold [1967] 提出的经典极限识别模型中,正例样本被逐轮呈现,学习者最终必须恢复出目标假设。最近,Kleinberg 和 Mullainathan [2024] 引入了极限生成,其中学习者最终必须输出目标支持集的新元素。这两条研究路线均聚焦于仅正例或完全标注的数据。然而,许多自然的监督信号本质上是关系性的而非单例的,它们编码的是样本之间的关系,而非单个样本的标签。我们开创了对极限情形下对比识别与生成的研究,其中学习者观察数据的对比呈现:一个满足 h(x)h(y)h(x)\ne h(y) 的无序对 {x,y}\{x,y\} 流,其中 hh 为未知的目标二元假设,但哪个元素为正例对学习者是隐藏的。我们首先在无噪声设置下给出三个结果:对比可识别类的精确刻画(对 Angluin [1980] 的 tell-tale 条件的一行式几何精炼);一个称为对比闭包维度的组合维度(Raman 等人 [2025] 中闭包维度的对比类比),并精确刻画了具有紧致样本复杂度的均匀对比生成;以及一个严格层级结构,其中对比生成与文本识别互不可比。然后我们证明了在有限对抗性损坏下的急剧反转:存在一些类,在任意有限损坏预算下均可由单一与预算无关的算法从对比对中识别,但在仅有一条损坏观测的情况下却无法从正例中识别。统一的技术对象是公共交叉图,它以单一覆盖与关联语言编码了成对歧义、族级生成障碍以及损坏缺陷。

关键词

引用

@article{arxiv.2605.06211,
  title  = {Contrastive Identification and Generation in the Limit},
  author = {Xiaoyu Li and Andi Han and Jiaojiao Jiang and Junbin Gao},
  journal= {arXiv preprint arXiv:2605.06211},
  year   = {2026}
}