中文

列表语言识别限情况的特征化

计算与语言 2025-11-07 v1 人工智能 数据结构与算法 机器学习

摘要

我们研究语言识别限情况的问题,即给定一系列来自目标语言的示例,学习者的目标是输出一系列针对目标语言的猜测序列,使得超出某个有限时间后的所有猜测都正确。Gold 的经典结果表明,对于几乎任何有趣的语言集合,语言在极限情况下的识别都是不可能的。后来的 Angluin 提出了语言集合的精确特征化,以解决这一问题。受近期针对相关问题(语言生成)积极结果的启发,我们重新审视经典的语言识别问题,在学习者额外获得生成每个时间步骤 kk 个猜测列表的能力后的设置。目标是确保在某个有限时间之后,每个时间步骤的一个猜测是正确的。我们给出了语言集合能在极限情况下的 kk-列表识别的精确特征化,这基于 Angluin 的特征化(语言识别列表大小为 1)。这进一步导致一个概念上令人满意的特征化:如果且仅如果一个语言集合可以分解为 kk 个语言集合的列表,每个语言集合都可以在极限情况下的列表大小为 1 的情况下进行识别,该语言集合就可以在极限情况下的 kk-列表中被识别。我们还利用我们的特征化来建立列表识别在统计设置下的速率,其中输入以 i.i.d. 方式从支持于该集合中某个语言的分布中抽取。我们的結果表明,如果一个集合可以在极限情况下的 kk-列表中被识别,那么该集合就可以在指数速率下进行 kk-列表识别,这是最佳的。另一方面,如果一个集合不能在极限情况下的 kk-列表中被识别,那么它不能以任何一个趋于零的速率进行 kk-列表识别。

关键词

引用

@article{arxiv.2511.04103,
  title  = {A Characterization of List Language Identification in the Limit},
  author = {Moses Charikar and Chirag Pabbaraju and Ambuj Tewari},
  journal= {arXiv preprint arXiv:2511.04103},
  year   = {2025}
}