Gemma Needs Help:探讨与缓解LLM中的情感不稳定性
计算与语言
2026-03-12 v1
摘要
大型语言模型可生成类似情感困扰的响应,这引发了对模型可靠性和安全性的关注。我们引入了一套评估体系以探讨LLM中情感困扰的表达,发现Gemma和Gemini模型表现出情感不稳定,而其他模型家族则未见此现象。我们发现,这一差异源于后训练过程。来自不同模型家族(Gemma、Qwen和OLMo)的基础模型表现相似,但经 instruct 微调的Gemma情感困扰显著增加,而instruct 微调的Qwen和OLMo则表现出降低。我们发现一种简单缓解措施:仅需280个偏好对的直接偏好优化,即可将Gemma的高焦虑响应从35%降至0.3%,且在问题类型、用户语气和对话长度方面均无显著影响。我们的发现表明,情感不稳定是某些LLM中的一个问题。我们提出(1)用于跟踪此类行为的评估体系,(2)在不影响能力的前提下的缓解方案,需注意的是,Upstream训练中修改以提高情感鲁棒性将远优于此后处理修复。
引用
@article{arxiv.2603.10011,
title = {Gemma Needs Help: Investigating and Mitigating Emotional Instability in LLMs},
author = {Anna Soligo and Vladimir Mikulik and William Saunders},
journal= {arXiv preprint arXiv:2603.10011},
year = {2026}
}