IntroLM: 通过预填充阶段自我评估实现内省式语言模型
计算与语言
2026-05-12 v2 人工智能
机器学习
摘要
大语言模型(LLM)运行的一个主要挑战是如何预测特定 LLM 是否会为给定查询生成足够高质量的输出。现有方法依赖于外部分类器,最常见的是基于 BERT 的模型,这些模型存在上下文窗口有限、表示能力受限以及额外计算开销等问题。我们提出了 IntroLM,一种使因果语言模型能够在预填充阶段预测自身输出质量而不影响生成的方法,该方法通过使用内省标记实现。通过引入仅对内省标记激活的标记条件 LoRA,模型学会预测给定查询的输出质量,同时保留原始主干行为并避免外部评估器。在问答基准测试上,应用于 Qwen3 8B 的 IntroLM 在成功预测方面达到了 90% 的 ROC AUC,比 DeBERTa 分类器高出 14%。当集成到多模型路由系统中时,IntroLM 实现了卓越的成本性能权衡,在相同可靠性下,延迟最多降低 33%,大模型使用量最多减少 50%。
引用
@article{arxiv.2601.03511,
title = {IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation},
author = {Hossein Hosseini Kasnavieh and Gholamreza Haffari and Chris Leckie and Adel N. Toosi},
journal= {arXiv preprint arXiv:2601.03511},
year = {2026}
}
备注
Accepted for publication in Findings of ACL 2026