中文

NL-PAC:LLM中介监督中的规范歧义与认证极小极大风险下限

机器学习 2026-07-09 v1 人工智能 统计理论

摘要

大型语言模型越来越多地为以自然语言指定的任务提供标签、评估和反馈。当规范允许多种解读,但监督渠道未揭示哪种解读在起作用时,额外的标签只会减少抽样误差,而无法解决由此产生的识别问题。我们引入了自然语言PAC(NL-PAC)框架,该框架使用固定模型的阈值化解码规律来定义可容许标签和候选目标。多个标签可容许的概率等于逐点可容许目标类别的直径,并且在目标盲监督下,每个学习者在任何样本量下都会承受至少为该直径一半的最坏情况风险;该类别的精确随机极小极大风险由一种独立于数据的策略实现。有限样本置信界限使得这些量可以从留出的无标签输入中得到认证。在一次冻结的Qwen 2.5-3B审计中,一个预先指定的提示产生了正的模型相对证书,而一个释义和精确规则控制则产生零。一项留出的桥接审计发现,提供的候选解读子句未能满足将证书转移到连贯解读所需的可容许性条件。该保证特定于被审计的模型、提示、阈值和输入分布;将其扩展到人类解释需要外部验证。

关键词

引用

@article{arxiv.2607.08961,
  title  = {NL-PAC: Specification Ambiguity and Certified Minimax Risk Floors in LLM-Mediated Supervision},
  author = {Berkay Anahtarci},
  journal= {arXiv preprint arXiv:2607.08961},
  year   = {2026}
}