超越外部监控器:提高大型语言模型透明性以便更轻松地进行监控
计算与语言
2026-05-28 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
大型语言模型(LLM)正在变得越来越有能力,但其思考和决策过程的机制仍不清晰。链式思维(CoT)通常用于外部化 LLM 的思考,但这一策略未能准确反映 LLM 的思考过程。基于 LLM 隐藏表示的技术提供了内部视角,以改善其潜在思考的可监控性。然而,之前的方法仅尝试开发外部模块,而未使 LLM 本身更易于监控。本文提出了一种新方法,TELLME,通过提高 LLM 的透明度帮助监控员识别不适合和敏感的行为。此外,我们展示了 TELLME 在去噪任务中的有效性,其中 LLM 在多模态测试集、不同架构和不同参数规模下均实现持续的改进。我们进一步从最优传输理论和经验视角分析了 TELLME 对 LLM 泛化能力的提升。
引用
@article{arxiv.2502.05242,
title = {Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring},
author = {Guanxu Chen and Jing Shao and Tao Luo and Lijie Hu and Qihao Lin and Dongrui Liu},
journal= {arXiv preprint arXiv:2502.05242},
year = {2026}
}
备注
28 pages,8 figures,15 tables