跨领域泛化在训练 LLM 监控器方面有多么有用?
人工智能
2026-05-13 v1
摘要
使用提示语言模型作为分类器可实现数据有限领域中的分类,但会捕失细调带来的鲁棒性和性能优势。我们研究在每个分类任务都有其提示词的情况下,对多个分类任务进行训练,是否能提高在新领域、使用新分类提示词上的性能。我们展示,这种训练在相邻领域中部分泛化,能够提高在训练期间未出现的任务上的分类性能。然而,我们识别出了一些特定边缘情况,其中细调模型无法遵循提示词,例如当分类提示词完全更改而数据领域保持与训练时相同的情况。我们表明分类训练可以与通用指令遵循训练混合进行,且(当做得好时)这种训练既保留了分类训练的优势,又缓解了其泛化失败的问题。令人惊讶的是,我们看到,这种无思考的监督分类训练可以泛化到带思考的分类和摘要任务中,这表明无思考的分类训练在构建其他类型的分类器和监控系统方面可能是工具性有用的。
引用
@article{arxiv.2605.12265,
title = {How Useful Is Cross-Domain Generalization for Training LLM Monitors?},
author = {Sam Martin and Fabien Roger},
journal= {arXiv preprint arXiv:2605.12265},
year = {2026}
}