论指令微调LLM对长输入中有害句子的敏感性
计算与语言
2026-05-27 v2 计算机与社会
摘要
大语言模型(LLM)日益频繁地处理长输入,然而对于有害句子稀疏嵌入此类输入时的模型行为,目前仍缺乏充分理解。我们提出了一项敏感性分析,探究LLM如何提取嵌入在长输入中的有害句子。我们通过组合中性句子与有害句子构建长输入,并系统性地改变四个因素:输入长度(600--30,000个token)、有害句子比例(0.01--0.50)、伤害表现形式(显式与隐式)以及有害句子在输入中的位置(开头、中间、结尾),从而实现可控的压力测试评估。在有毒、冒犯性和仇恨内容上,以及跨LLaMA-3.1、Qwen-2.5和Mistral模型的实验揭示了一致的模式:敏感性相对于有害句子占比呈非单调关系,在中等水平处达到峰值;敏感性随输入长度增加而下降;置于输入靠前位置的有害句子会被更强烈地优先处理;显式伤害比隐式伤害更容易被可靠识别。这些发现提供了在可控压力条件下LLM如何优先处理长输入中有害句子的系统性视角,突显了其在安全相关应用中新兴的优势与尚存的挑战。
引用
@article{arxiv.2510.05864,
title = {On the Sensitivity of Instruction-tuned LLMs to Harmful Sentences in Long Inputs},
author = {Faeze Ghorbanpour and Alexander Fraser},
journal= {arXiv preprint arXiv:2510.05864},
year = {2026}
}