列表语言识别限情况的特征化
计算与语言
2025-11-07 v1 人工智能
数据结构与算法
机器学习
摘要
我们研究语言识别限情况的问题,即给定一系列来自目标语言的示例,学习者的目标是输出一系列针对目标语言的猜测序列,使得超出某个有限时间后的所有猜测都正确。Gold 的经典结果表明,对于几乎任何有趣的语言集合,语言在极限情况下的识别都是不可能的。后来的 Angluin 提出了语言集合的精确特征化,以解决这一问题。受近期针对相关问题(语言生成)积极结果的启发,我们重新审视经典的语言识别问题,在学习者额外获得生成每个时间步骤 个猜测列表的能力后的设置。目标是确保在某个有限时间之后,每个时间步骤的一个猜测是正确的。我们给出了语言集合能在极限情况下的 -列表识别的精确特征化,这基于 Angluin 的特征化(语言识别列表大小为 1)。这进一步导致一个概念上令人满意的特征化:如果且仅如果一个语言集合可以分解为 个语言集合的列表,每个语言集合都可以在极限情况下的列表大小为 1 的情况下进行识别,该语言集合就可以在极限情况下的 -列表中被识别。我们还利用我们的特征化来建立列表识别在统计设置下的速率,其中输入以 i.i.d. 方式从支持于该集合中某个语言的分布中抽取。我们的結果表明,如果一个集合可以在极限情况下的 -列表中被识别,那么该集合就可以在指数速率下进行 -列表识别,这是最佳的。另一方面,如果一个集合不能在极限情况下的 -列表中被识别,那么它不能以任何一个趋于零的速率进行 -列表识别。
引用
@article{arxiv.2511.04103,
title = {A Characterization of List Language Identification in the Limit},
author = {Moses Charikar and Chirag Pabbaraju and Ambuj Tewari},
journal= {arXiv preprint arXiv:2511.04103},
year = {2025}
}