逆语言建模:面向稳健且具 grounding 能力的大语言模型
计算与语言
2025-10-03 v1
摘要
当前大语言模型的防御机制布局零散且不成熟,与分类器相关工作形成鲜明对比。为进一步提升大语言模型的对抗鲁棒性,我们提出逆语言建模 (ILM),一个统一框架,同时 1) 改善大语言模型对输入扰动的鲁棒性,2) 通过反转模型输出识别潜在有毒或不安全输入触发器,实现原生 grounding。ILM 将大语言模型从静态生成器转变为可分析且稳健的系统,可能有助于红队测试。ILM 为构建不仅稳健、具 grounding 能力,且在可控性和可信度方面具有根本优势的下一代大语言模型奠定了基础。代码已公开于 github.com/davegabe/pag-llm。
引用
@article{arxiv.2510.01929,
title = {Inverse Language Modeling towards Robust and Grounded LLMs},
author = {Davide Gabrielli and Simone Sestito and Iacopo Masi},
journal= {arXiv preprint arXiv:2510.01929},
year = {2025}
}