“古怪”语言模型的机制异常检测
机器学习
2025-04-15 v1 计算与语言
摘要
随着LLM能力的增长,监督LLM的任务变得更加具有挑战性。如果LLM对监督者未知的因素敏感,就可能发生监督失败。我们研究了机制异常检测(MAD)作为一种增强对能力模型监督的技术;我们利用内部模型特征来识别异常训练信号,以便对其进行调查或丢弃。我们训练检测器来标记与训练环境差异显著的测试环境中的点,并使用大量不同的检测器特征和评分规则来检测一组“古怪”语言模型中的异常。我们发现检测器在某些任务上可以达到高区分度,但没有一个检测器在所有模型和任务上都有效。MAD技术在低风险应用中可能有效,但如果要在高风险环境中使用,可能需要在检测和评估方面取得进展。
引用
@article{arxiv.2504.08812,
title = {Mechanistic Anomaly Detection for "Quirky" Language Models},
author = {David O. Johnston and Arkajyoti Chakraborty and Nora Belrose},
journal= {arXiv preprint arXiv:2504.08812},
year = {2025}
}
备注
ICLR Building Trust Workshop 2025