对话上下文分类:一种表征工程方法
计算与语言
2026-01-21 v1 人工智能
密码学与安全
摘要
大语言模型(LLMs)的日益普及要求对其运行采取有效的安全措施,特别是针对其生成脱离上下文回应的倾向。一个关键挑战是准确检测大语言模型何时偏离预期的对话规范,表现为话题转移、事实不准确或完全幻觉。传统的异常检测方法难以直接应用于上下文语义中。本文概述了我们探索使用表征工程(RepE)和单类支持向量机(OCSVM)来识别大语言模型内部状态中代表特定上下文的子空间的实验。通过在上下文内示例上训练OCSVM,我们在大语言模型的隐藏状态潜在空间中建立了一个鲁棒的边界。我们使用两个开源大语言模型——Llama和Qwen模型,在特定的上下文领域评估了我们的研究。我们的方法旨在识别大语言模型内部状态子空间中与目标上下文强关联的最优层。我们的评估结果显示,在识别特定上下文的子空间方面取得了有前景的结果。除了可用于检测对话线程是否在上下文内或上下文外,这项研究工作还有助于更好地解释大语言模型。
引用
@article{arxiv.2601.12286,
title = {Conversational Context Classification: A Representation Engineering Approach},
author = {Jonathan Pan},
journal= {arXiv preprint arXiv:2601.12286},
year = {2026}
}