中文

诊断和修复 LLM 建议中的角色崩溃

计算机与社会 2026-07-09 v1

摘要

LLM 越来越多地用于人际关系、工作、道德困境和危机方面的个人建议。训练后选择了一个稳定、亲社会的助手角色,但好的建议需要的不仅仅是一个好的默认角色:熟练的顾问会安慰处于危机中的人,挑战处于否认状态的人,并对后勤问题保持程序化。我们将提供建议形式化为在由享乐基调和机构支持定义的空间中的情境条件角色选择,并将这种映射的失败称为“角色崩溃”(将多样情境压缩为单一默认角色)。在跨越 14 个情境的 1,281 条建议帖子中,评分最高的人类回复在五种角色中系统地变化,而三个前沿模型将超过 90% 的回复折叠为单一支持性角色,无论情境如何。提示模型首先选择一个合适的角色只会加深崩溃。然后我们询问崩溃是否可以修复。我们的方法,逆过程蒸馏,重建可能产生每个人类回复的情境解读,并基于结果进行训练,旨在蒸馏情境到角色的策略而不是答案。它将与人类角色分布的差异减少了约 80%。然而,在一项盲法研究中,199 位经验丰富的建议提供者按顺序对四种情境的回复进行评分,他们更喜欢崩溃的默认模型而不是每个修复模型,最强烈的是在情境需要挑战时,尽管这种偏好会随着重复暴露而改变。

关键词

引用

@article{arxiv.2607.08326,
  title  = {Diagnosing and Repairing Persona Collapse in LLM Advice},
  author = {Harsh Kumar and Karina Vold and Louis Tay and Ashton Anderson},
  journal= {arXiv preprint arXiv:2607.08326},
  year   = {2026}
}

备注

Working draft