从隐式到显式:增强大语言模型的自我识别能力
计算与语言
2026-01-13 v2 人工智能
摘要
大语言模型(LLMs)已被证明具有一定程度的自我识别能力,该能力用于识别给定文本是否由它们自身生成。先前的研究表明,这种能力在配对呈现范式(PPP)下能够可靠地表达,即向模型呈现两段文本,并要求其选择哪一段是它自己生成的。然而,在个体呈现范式(IPP)下,即仅给模型一段文本以判断作者身份时,性能会急剧下降。尽管这一现象已被观察到,但其根本原因尚未得到系统分析。在本文中,我们首先探究了这种失败的原因,并将其归因于隐式自我识别(ISR)。ISR描述了大语言模型中内部表征与输出行为之间的差距:在IPP场景下,模型在其特征空间中编码了自我识别信息,但其识别自生成文本的能力仍然很差。为了减轻大语言模型的ISR,我们提出了认知手术(CoSur),这是一个包含四个主要模块的新颖框架:表征提取、子空间构建、作者身份判别和认知编辑。实验结果表明,我们提出的方法在IPP场景下提高了三种不同大语言模型的自我识别性能,分别达到了99.00%、97.69%和97.13%的平均准确率。
引用
@article{arxiv.2508.14408,
title = {From Implicit to Explicit: Enhancing Self-Recognition in Large Language Models},
author = {Yinghan Zhou and Weifeng Zhu and Juan Wen and Wanli Peng and Zhengxian Wu and Yiming Xue},
journal= {arXiv preprint arXiv:2508.14408},
year = {2026}
}