Llama3-8b-Instruct 自生成文本识别能力的检验与控制
机器学习
2026-05-19 v3 人工智能
计算与语言
摘要
有报告称,大语言模型能够识别其自身的输出。鉴于这一现象对 AI 安全具有潜在影响,却相对缺乏研究,本文旨在调查这一现象,探讨其在行为层面是否稳健存在、观察到的行为是如何实现的,以及是否可以被控制。首先,我们发现 Llama3-8b-Instruct 聊天模型——但非基础 Llama3-8b 模型——能够可靠地区分其自身的输出与人类的输出,并提供证据表明该聊天模型可能正在利用其在后训练期间获得的关于自身输出的经验,以成功完成写入识别任务。其次,我们识别出残差流中的一个向量,其在模型对自写入文本识别判断正确时被差异性激活,表明该向量对与自我撰写相关的信息具有响应,提供证据表明该向量与模型中的“自我”概念有关,并证明该向量在模型感知和断言自我撰写能力中具有因果关系。最后,我们展示该向量可用于控制模型的行为及其感知,通过将该向量应用于模型生成输出时可引导模型声称或否认撰写 authorship,亦可通过将该向量应用于模型读取文本时引导模型相信或否认其撰写任意文本。
引用
@article{arxiv.2410.02064,
title = {Inspection and Control of Self-Generated-Text Recognition Ability in Llama3-8b-Instruct},
author = {Christopher Ackerman and Nina Panickssery},
journal= {arXiv preprint arXiv:2410.02064},
year = {2026}
}
备注
10 pages, 13 figs, 2 tables, accepted as conference paper to ICLR 2025